> ML_DATASET // LIBRISPEECH-ASR-CORPUS_v1.0
LibriSpeech ASR Corpus (Panayotov et al. 2015)
Johns Hopkins University / Daniel Povey · Speech Recognition & Acoustic Modeling · 1,000 hours of 16kHz read English audiobooks with aligned text transcripts
Speech Recognition & Acoustic ModelingCC-BY-4.01,000 hours of 16kHz read English audiobooks with aligned text transcriptsopen
Veri Profili ve Özellikler
Etiket Tipi:Word-level and sentence-level clean/other acoustic transcripts
Diller:en
Lisans Seviyesi:permissive-open-source
Modaliteler:audio, text
Amaçlanan Kullanım (Intended Use)
- Otomatik konuşma tanıma (ASR) modelleri ve Whisper değerlendirmeleri için standart kıyaslama
Yasaklanan / Kaçınılması Gereken Kullanım
- Yüksek gürültülü endüstriyel ortamlarda kendiliğinden konuşma tanıma
Önyargı, Veri Sızıntısı ve Gizlilik Risk Analizi
Kişisel Veri Riskleri (Privacy Risks):
LibriVox projesinden gönüllü ses kayıtları; kamu malı sesli kitaplar.
Bilinen Önyargılar (Known Bias):
Edebi metin okuma sesi; düşük arka plan gürültüsü; yaşlı demografik aksanlar.
Veri Sızıntısı Riski (Known Leakage):
Resmi test-clean ve test-other ayrımları konuşmacı kimliğine göre kesinlikle ayrılmıştır.
