> ML_LITERATURE // PEEBLES-XIE-2023-SCALABLE-DIFFUSION-MODELS-WITH-TRANSFORMERS_v1.0
Scalable Diffusion Models with Transformers (DiT)
William Peebles, Saining Xie · IEEE International Conference on Computer Vision (ICCV) (2023)
seminal-architecture2023industry-standardthirdPartyReproduced
Principal Contribution
Replaced traditional U-Net backbones in latent diffusion with Vision Transformers (DiT), proving predictable compute scaling laws for generative diffusion.
Operational Relevance
The core architectural backbone powering next-generation diffusion systems: OpenAI Sora, Stable Diffusion 3, Flux.1, and PixArt.
Assumptions
- Operating on sequences of latent patches with adaptive layer norm conditioning scales smoothly with increased model capacity and compute
Limitations
- Quadratic sequence scaling on high-resolution latent patch sequences without windowed or linear attention mechanisms
Connected Algorithms, Architectures & Tools
Related Algorithms:
Related Architectures:
Implementing Libraries:
