Skip to main content

> ML_LITERATURE // RAMESH-2021-ZERO-SHOT-TEXT-TO-IMAGE-GENERATION-DALLE_v1.0

Zero-Shot Text-to-Image Generation (DALL-E)

Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever · International Conference on Machine Learning (ICML) (2021)

seminal-architecture2021foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Görüntüleri 32x32 token'a sıkıştırmak için bir dVAE eğitti ve birleştirilmiş metin-görüntü dizilerini 12 milyar parametreli bir Transformer ile otoregresif olarak modelledi.

Operasyonel ve Mühendislik Uygunluğu

Üretimde task-image-generation dağıtımı için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Uzamsal özellik tutarlılığı ve veri manifoldu yapısı sürekli temsil hipotezlerine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Hesaplama karmaşıklığı uzamsal çözünürlük ve parametre kapasitesi ile ölçeklenir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: