Skip to main content

> ML_DATASET // THE-STACK-V2-CODE_v1.0

The Stack v2: The Next Generation Code Pretraining Dataset

BigCode Project / Software Heritage / Hugging Face · Code Intelligence & Program Synthesis · 67.5 TB raw source code across 600+ programming languages

Code Intelligence & Program SynthesisApache-2.0 (Dataset Tooling) / Permissive Open Source (Code Licenses)67.5 TB raw source code across 600+ programming languagesopen

Veri Profili ve Özellikler

Etiket Tipi:Permissively licensed code repositories with metadata, Git commits, and docstrings
Diller:en, code
Lisans Seviyesi:permissive-open-source
Modaliteler:text, code

Amaçlanan Kullanım (Intended Use)

  • Ayrılma (opt-out) uyumluluğuyla kod temel modellerini (StarCoder 2) eğitme

Yasaklanan / Kaçınılması Gereken Kullanım

  • Kötü amaçlı yazılım üretme veya sıfır gün açıklarını istismar etme

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Sabit kodlanmış sırlar, API anahtarları, özel anahtarlar ve geliştirici e-postaları için taranmıştır.

Bilinen Önyargılar (Known Bias):

Popüler dillerin (JavaScript, Python, Java, C++, Go, Rust) baskınlığı.

Veri Sızıntısı Riski (Known Leakage):

HumanEval, MBPP ve SWE-bench'e karşı veri kirliliği filtreleri uygulanmıştır.

Uyumlu Araçlar ve Kütüphaneler