> ML_LITERATURE // RAMESH-2021-ZERO-SHOT-TEXT-TO-IMAGE-GENERATION-DALLE_v1.0
Zero-Shot Text-to-Image Generation (DALL-E)
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever · International Conference on Machine Learning (ICML) (2021)
seminal-architecture2021foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Görüntüleri 32x32 token'a sıkıştırmak için bir dVAE eğitti ve birleştirilmiş metin-görüntü dizilerini 12 milyar parametreli bir Transformer ile otoregresif olarak modelledi.
Operasyonel ve Mühendislik Uygunluğu
Üretimde task-image-generation dağıtımı için yetkili referans olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Uzamsal özellik tutarlılığı ve veri manifoldu yapısı sürekli temsil hipotezlerine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Hesaplama karmaşıklığı uzamsal çözünürlük ve parametre kapasitesi ile ölçeklenir
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
