Skip to main content

> ML_LITERATURE // PEEBLES-XIE-2023-SCALABLE-DIFFUSION-MODELS-WITH-TRANSFORMERS_v1.0

Scalable Diffusion Models with Transformers (DiT)

William Peebles, Saining Xie · IEEE International Conference on Computer Vision (ICCV) (2023)

seminal-architecture2023industry-standardthirdPartyReproduced

Principal Contribution

Replaced traditional U-Net backbones in latent diffusion with Vision Transformers (DiT), proving predictable compute scaling laws for generative diffusion.

Operational Relevance

The core architectural backbone powering next-generation diffusion systems: OpenAI Sora, Stable Diffusion 3, Flux.1, and PixArt.

Assumptions

  • Operating on sequences of latent patches with adaptive layer norm conditioning scales smoothly with increased model capacity and compute

Limitations

  • Quadratic sequence scaling on high-resolution latent patch sequences without windowed or linear attention mechanisms

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: