> ML_LITERATURE // KWON-2023-EFFICIENT-MEMORY-MANAGEMENT-LARGE-LANGUAGE-MODEL-SERVING-PAGEDATTENTION_v1.0
Efficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, Ion Stoica · ACM Symposium on Operating Systems Principles (SOSP) (2023)
systems2023industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
İşletim sistemi sanal bellek sayfalamasından esinlenen PagedAttention'ı tanıtarak KV-önbellek parçalanmasını ortadan kaldırdı ve 2-4 kat daha yüksek sunum verimi sağladı.
Operasyonel ve Mühendislik Uygunluğu
Endüstri standardı yüksek verimli açık kaynaklı LLM çıkarım sunum motoru olan vLLM'i güçlendiren temel yenilik.
Temel Varsayımlar (Assumptions)
- KV önbellek belleği, dikkat doğruluğunu etkilemeden sayfa tablolarıyla dizinlenen bitişik olmayan fiziksel bellek bloklarına bölünebilir
Kısıtlar ve Sınırlamalar (Limitations)
- Sayfa boyutu ayarı dahili parçalanma ile sayfa tablosu ek yükünü dengeler; karmaşık CUDA bellek yönetimi
