> ML_DATASET // THE-STACK-V2-CODE_v1.0
The Stack v2: The Next Generation Code Pretraining Dataset
BigCode Project / Software Heritage / Hugging Face · Code Intelligence & Program Synthesis · 67.5 TB raw source code across 600+ programming languages
Code Intelligence & Program SynthesisApache-2.0 (Dataset Tooling) / Permissive Open Source (Code Licenses)67.5 TB raw source code across 600+ programming languagesopen
Veri Profili ve Özellikler
Etiket Tipi:Permissively licensed code repositories with metadata, Git commits, and docstrings
Diller:en, code
Lisans Seviyesi:permissive-open-source
Modaliteler:text, code
Amaçlanan Kullanım (Intended Use)
- Ayrılma (opt-out) uyumluluğuyla kod temel modellerini (StarCoder 2) eğitme
Yasaklanan / Kaçınılması Gereken Kullanım
- Kötü amaçlı yazılım üretme veya sıfır gün açıklarını istismar etme
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Sabit kodlanmış sırlar, API anahtarları, özel anahtarlar ve geliştirici e-postaları için taranmıştır.
Bilinen Önyargılar (Known Bias):
Popüler dillerin (JavaScript, Python, Java, C++, Go, Rust) baskınlığı.
Veri Sızıntısı Riski (Known Leakage):
HumanEval, MBPP ve SWE-bench'e karşı veri kirliliği filtreleri uygulanmıştır.
