> ML_KUTUPHANE // VLLM_v1.0
vLLM
vLLM Project / UC Berkeley — Büyük Dil Modelleri için yüksek verimli ve bellek dostu çıkarım ve sunum motoru.
serving-inferencev0.6.2Apache-2.0qualified
Model Eğitimi (Training)
Bu kütüphane optimize edilmiş bir inference motorudur; model eğitimi için kullanılmaz.
Model Sunumu (Inference)
Inference Hızlandırıcıları:
CPUCUDAROCM
Hedef Ortamlar (Targets):server
Kuantizasyon Formatları:AWQ, GPTQ, FP8, SqueezeLLM, bitsandbytes
Neleri Sağlar (Ne Yapar)
- +KV-cache bellek parçalanmasını önleyen PagedAttention sanal bellek yönetimi
- +Standart Hugging Face'e göre 2x-4x daha yüksek verim sağlayan sürekli istek gruplama (continuous batching)
- +OpenAI uyumlu REST ve akışlı tamamlama API sunucusu
Neleri Sağlamaz (Ne Yapmaz)
- -Temel modelleri eğitme veya model ağırlıklarını güncelleme
- -Apple Silicon MPS veya web tarayıcılarında yerel olarak çalışma
- -Transformer dışındaki klasik tablo modellerini sunma
>Uygun İş Tipleri
- Yüksek eşzamanlı üretim LLM çıkarım sunucusu (Llama 3, Mistral, Qwen)
- Çok kiracılı kurumsal sohbet ve kod tamamlama servisleri
- GPU kümelerinde kuantalanmış modelleri (AWQ, GPTQ, FP8) sunma
>Uygun Olmayan İş Tipleri
- Sinir ağı parametrelerini eğitme veya ince ayar yapma
- Harici GPU bulunmayan dizüstü bilgisayarlarda çalıştırma (llama.cpp veya Ollama tercih edin)
Veri Yerleşimi ve İkameti
Süreç içi GPU belleği (VRAM). İstemler özel kurumsal altyapıyı kesinlikle terk etmez.
Güvenlik Değerlendirmesi
HTTP API'sini ters vekil sunucu veya API ağ geçidiyle koruyun; vLLM dahili hız sınırlayıcı barındırmaz.
Operasyonel Metrikler ve Bilinen Kısıtlar
Olgunluk:mature
Öğrenme Eğrisi:moderate
Operasyon Yükü:high
Maliyet Seviyesi:high-compute
> Bilinen Kısıtlamalar:
- Başlangıçta yüksek GPU bellek tahsisi yapar (varsayılan olarak %90 VRAM ayırır).
- Çoklu GPU tensör paralelliği ve ray işçilerini yapılandırmak yüksek operasyonel uzmanlık gerektirir.
İlişkili Üretim Arıza Paternleri (Incidentpedia)
Bu kütüphaneyi üretimde kullanırken aşağıdaki arıza senaryolarına karşı fail-closed korumalar uygulayın:
> Birincil Kanıt ve Doğrulama Kaynakları
Efficient Memory Management for Large Language Model Serving with PagedAttentionpaper • >=0.4.0, <=0.6.x
2026-09-25HIGH
