> ML_LITERATURE // DAO-2022-FLASHATTENTION-FAST-MEMORY-EFFICIENT-EXACT-ATTENTION_v1.0
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, Christopher Ré · Advances in Neural Information Processing Systems (NeurIPS) (2022)
hardware-compiler2022industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
Çevrimiçi softmax yeniden normalizasyonu kullanarak hızlı GPU SRAM ile yavaş HBM arasında kesin öz dikkati döşedi ve karesel bellek okuma/yazmalarını ortadan kaldırdı.
Operasyonel ve Mühendislik Uygunluğu
PyTorch (scaled_dot_product_attention), vLLM, Hugging Face, TensorRT-LLM ve her modern LLM eğitim çalıştırmasına entegre edilmiştir.
Temel Varsayımlar (Assumptions)
- GPU hesaplama FLOP'ları bol miktardadır, ancak Bellek G/Ç (HBM bant genişliği) transformer öz dikkatindeki temel darboğazdır
Kısıtlar ve Sınırlamalar (Limitations)
- Belirli GPU tensör çekirdeği mikro mimarilerini (Ampere, Hopper) hedefleyen özel olarak ayarlanmış CUDA/Triton çekirdekleri gerektirir
