> ML_LITERATURE // SHAZEER-2019-FAST-TRANSFORMER-DECODING-MULTI-QUERY-ATTENTION_v1.0
Fast Transformer Decoding: One Write-Head is All You Need
Noam Shazeer · arXiv preprint (2019)
algorithm2019industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
Otoregresif üretim sırasında KV önbellek bellek bant genişliği darboğazlarını ortadan kaldırmak için tüm Sorgu başlıkları arasında tek bir Anahtar ve Değer başlığını paylaşan Multi-Query Attention (MQA) icat etti.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
