Skip to main content

> ML_LITERATURE // KONG-2020-HIFI-GAN-GENERATIVE-ADVERSARIAL-NETWORKS-SPEECH-SYNTHESIS_v1.0

HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis

Jungil Kong, Jaehyeon Kim, Jaekyoung Bae · Advances in Neural Information Processing Systems (NeurIPS) (2020)

seminal-architecture2020industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

GAN tabanlı sinirsel ses sentezi için çok periyotlu (MPD) ve çok ölçekli (MSD) ayırt ediciler tasarlayarak CPU'da gerçek zamandan daha hızlı 22.05 kHz ses üretti.

Operasyonel ve Mühendislik Uygunluğu

Üretim sistemlerinde task-text-to-speech uygulaması için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Temel uzamsal-zamansal süreklilik ve alan dağılımsal kararlılığı geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Performans ölçekleme ve hesaplama ayak izi algılama alanı derinliğine, dizi uzunluğuna ve çözünürlüğe bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: