> ML_LITERATURE // SAHARIA-2022-PHOTOREALISTIC-TEXT-TO-IMAGE-DIFFUSION-IMAGEN_v1.0
Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding (Imagen)
Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L. Denton, Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, Mohammad Norouzi · Advances in Neural Information Processing Systems (NeurIPS) (2022)
seminal-architecture2022foundationalthirdPartyReproduced
Principal Contribution
Discovered that generic large pre-trained text-only language models (T5-XXL) are surprisingly effective text encoders for diffusion, outperforming multimodal CLIP text encoders on alignment and fidelity.
Operational Relevance
Serves as qualified reference for deploying task-image-generation in production.
Assumptions
- Spatial feature coherence and data manifold structure adhere to continuous representation hypotheses
Limitations
- Computational complexity scales with spatial resolution and parameter capacity
Connected Algorithms, Architectures & Tools
Related Algorithms:
Related Architectures:
Implementing Libraries:
