> ML_LITERATURE // SAHARIA-2022-PHOTOREALISTIC-TEXT-TO-IMAGE-DIFFUSION-IMAGEN_v1.0
Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding (Imagen)
Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L. Denton, Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, Mohammad Norouzi · Advances in Neural Information Processing Systems (NeurIPS) (2022)
seminal-architecture2022foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Büyük önceden eğitilmiş metin dil modellerinin (T5-XXL) difüzyon için şaşırtıcı derecede etkili metin kodlayıcıları olduğunu ve hizalama ile doğrulukta multimodal CLIP metin kodlayıcılarını geride bıraktığını keşfetti.
Operasyonel ve Mühendislik Uygunluğu
Üretimde task-image-generation dağıtımı için yetkili referans olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Uzamsal özellik tutarlılığı ve veri manifoldu yapısı sürekli temsil hipotezlerine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Hesaplama karmaşıklığı uzamsal çözünürlük ve parametre kapasitesi ile ölçeklenir
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
