> ML_DATASET // MOZILLA-COMMON-VOICE_v1.0
Mozilla Common Voice (Multilingual Speech Corpus)
Mozilla Foundation · Multilingual Speech Recognition · 30,000+ hours across 120+ languages recorded by global crowdsourced volunteers
Multilingual Speech RecognitionCC0-1.0 (Public Domain Dedication)30,000+ hours across 120+ languages recorded by global crowdsourced volunteersopen
Veri Profili ve Özellikler
Etiket Tipi:Validated crowdsourced transcripts with demographic metadata (age, sex, accent)
Diller:en, es, fr, de, tr, ar, zh, ja, ru, sw
Lisans Seviyesi:permissive-open-source
Modaliteler:audio, text
Amaçlanan Kullanım (Intended Use)
- Çeşitli, aksana duyarlı çok dilli konuşma tanıma ve sesli yapay zeka sistemleri eğitimi
Yasaklanan / Kaçınılması Gereken Kullanım
- Konuşmacının açık izni olmadan ses klonlama
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
Gönüllü ses kayıtları ve isteğe bağlı beyan edilen demografik bilgiler.
Bilinen Önyargılar (Known Bias):
Değişken mikrofon kaliteleri; belirli düşük kaynaklı dillerde erkek sesi ağırlığı.
Veri Sızıntısı Riski (Known Leakage):
Temiz ayrım kuralları eğitim ve test setleri arasında tek konuşmacı sızıntısını önler.
