Skip to main content

> ML_LITERATURE // BAEVSKI-2020-WAV2VEC-2-FRAMEWORK-SELF-SUPERVISED-LEARNING-SPEECH_v1.0

wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, Michael Auli · Advances in Neural Information Processing Systems (NeurIPS) (2020)

seminal-architecture2020industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

Zaman adımları boyunca örtük ses temsillerini maskeledi ve kuantalanmış temsiller üzerinde karşıtsal kayıpla eğiterek 10 dakikalık etiketli veriyle en yüksek ASR başarısına ulaştı.

Operasyonel ve Mühendislik Uygunluğu

Üretim sistemlerinde task-speech-recognition uygulaması için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Temel uzamsal-zamansal süreklilik ve alan dağılımsal kararlılığı geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Performans ölçekleme ve hesaplama ayak izi algılama alanı derinliğine, dizi uzunluğuna ve çözünürlüğe bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: