Skip to main content

> ML_LITERATURE // SAHARIA-2022-PHOTOREALISTIC-TEXT-TO-IMAGE-DIFFUSION-IMAGEN_v1.0

Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding (Imagen)

Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L. Denton, Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, Mohammad Norouzi · Advances in Neural Information Processing Systems (NeurIPS) (2022)

seminal-architecture2022foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Büyük önceden eğitilmiş metin dil modellerinin (T5-XXL) difüzyon için şaşırtıcı derecede etkili metin kodlayıcıları olduğunu ve hizalama ile doğrulukta multimodal CLIP metin kodlayıcılarını geride bıraktığını keşfetti.

Operasyonel ve Mühendislik Uygunluğu

Üretimde task-image-generation dağıtımı için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Uzamsal özellik tutarlılığı ve veri manifoldu yapısı sürekli temsil hipotezlerine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Hesaplama karmaşıklığı uzamsal çözünürlük ve parametre kapasitesi ile ölçeklenir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: