Skip to main content

> ML_DATASET // MOZILLA-COMMON-VOICE_v1.0

Mozilla Common Voice (Multilingual Speech Corpus)

Mozilla Foundation · Multilingual Speech Recognition · 30,000+ hours across 120+ languages recorded by global crowdsourced volunteers

Multilingual Speech RecognitionCC0-1.0 (Public Domain Dedication)30,000+ hours across 120+ languages recorded by global crowdsourced volunteersopen

Veri Profili ve Özellikler

Etiket Tipi:Validated crowdsourced transcripts with demographic metadata (age, sex, accent)
Diller:en, es, fr, de, tr, ar, zh, ja, ru, sw
Lisans Seviyesi:permissive-open-source
Modaliteler:audio, text

Amaçlanan Kullanım (Intended Use)

  • Çeşitli, aksana duyarlı çok dilli konuşma tanıma ve sesli yapay zeka sistemleri eğitimi

Yasaklanan / Kaçınılması Gereken Kullanım

  • Konuşmacının açık izni olmadan ses klonlama

Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi

Kişisel Veri Riskleri (Privacy Risks):

Gönüllü ses kayıtları ve isteğe bağlı beyan edilen demografik bilgiler.

Bilinen Önyargılar (Known Bias):

Değişken mikrofon kaliteleri; belirli düşük kaynaklı dillerde erkek sesi ağırlığı.

Veri Sızıntısı Riski (Known Leakage):

Temiz ayrım kuralları eğitim ve test setleri arasında tek konuşmacı sızıntısını önler.

Uyumlu Araçlar ve Kütüphaneler