Skip to main content

> ML_LITERATURE // RAMESH-2022-HIERARCHICAL-TEXT-CONDITIONAL-IMAGE-GENERATION-DALLE2_v1.0

Hierarchical Text-Conditional Image Generation with CLIP Latents (DALL-E 2 / unCLIP)

Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, Mark Chen · arXiv preprint (2022)

seminal-architecture2022foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Metin altyazılarını CLIP görüntü gömmelerine eşleyen bir difüzyon öncülü ve ardından yüksek çözünürlüklü pikseller üreten bir difüzyon kod çözücüsü kullanarak CLIP görüntü kodlayıcısını tersine çevirdi.

Operasyonel ve Mühendislik Uygunluğu

Üretimde task-image-generation dağıtımı için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Uzamsal özellik tutarlılığı ve veri manifoldu yapısı sürekli temsil hipotezlerine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Hesaplama karmaşıklığı uzamsal çözünürlük ve parametre kapasitesi ile ölçeklenir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: