Skip to main content

> ML_LITERATURE // KWON-2023-EFFICIENT-MEMORY-MANAGEMENT-LARGE-LANGUAGE-MODEL-SERVING-PAGEDATTENTION_v1.0

Efficient Memory Management for Large Language Model Serving with PagedAttention

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, Ion Stoica · ACM Symposium on Operating Systems Principles (SOSP) (2023)

systems2023industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

İşletim sistemi sanal bellek sayfalamasından esinlenen PagedAttention'ı tanıtarak KV-önbellek parçalanmasını ortadan kaldırdı ve 2-4 kat daha yüksek sunum verimi sağladı.

Operasyonel ve Mühendislik Uygunluğu

Endüstri standardı yüksek verimli açık kaynaklı LLM çıkarım sunum motoru olan vLLM'i güçlendiren temel yenilik.

Temel Varsayımlar (Assumptions)

  • KV önbellek belleği, dikkat doğruluğunu etkilemeden sayfa tablolarıyla dizinlenen bitişik olmayan fiziksel bellek bloklarına bölünebilir

Kısıtlar ve Sınırlamalar (Limitations)

  • Sayfa boyutu ayarı dahili parçalanma ile sayfa tablosu ek yükünü dengeler; karmaşık CUDA bellek yönetimi

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: