Skip to main content

> ML_LITERATURE // DAO-2022-FLASHATTENTION-FAST-MEMORY-EFFICIENT-EXACT-ATTENTION_v1.0

FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, Christopher Ré · Advances in Neural Information Processing Systems (NeurIPS) (2022)

hardware-compiler2022industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

Çevrimiçi softmax yeniden normalizasyonu kullanarak hızlı GPU SRAM ile yavaş HBM arasında kesin öz dikkati döşedi ve karesel bellek okuma/yazmalarını ortadan kaldırdı.

Operasyonel ve Mühendislik Uygunluğu

PyTorch (scaled_dot_product_attention), vLLM, Hugging Face, TensorRT-LLM ve her modern LLM eğitim çalıştırmasına entegre edilmiştir.

Temel Varsayımlar (Assumptions)

  • GPU hesaplama FLOP'ları bol miktardadır, ancak Bellek G/Ç (HBM bant genişliği) transformer öz dikkatindeki temel darboğazdır

Kısıtlar ve Sınırlamalar (Limitations)

  • Belirli GPU tensör çekirdeği mikro mimarilerini (Ampere, Hopper) hedefleyen özel olarak ayarlanmış CUDA/Triton çekirdekleri gerektirir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: