---
title: "Bölüm 4: Spot Preemptible GPU Yönetimi ve vLLM Çıkarımı — Bulut Ekonomisi | TinyCTO"
description: "2 dakikalık Spot sonlandırma yönetimi, vLLM PagedAttention, spekülatif kod çözme ve çok bölgeli GPU yedekleme."
image: "https://tinycto.tv/assets/cloud-economics/cloud_economics_manuals_og.jpg"
canonicalUrl: "https://tinycto.tv/tr/cloud-economics/manuals/04-spot-gpu-yonetimi"
locale: "tr"
---

# Bölüm 4: Spot Preemptible GPU Yönetimi ve vLLM Çıkarımı

## 1. Yönetici Özeti ve Ekonomi
Üretici Yapay Zeka ve Büyük Dil Modeli (LLM) sunumu, modern teknoloji şirketlerinde en hızlı büyüyen maliyet merkezidir. Özel On-Demand GPU sunucuları (örneğin saatte \$40.96 tutan 8x NVIDIA A100 80GB içeren AWS p4de.24xlarge veya saatte \$5.67 tutan 4x A10G içeren g5.12xlarge), düşük kullanım dönemlerinde sermayeyi hızla eritir.

**Spot Instances**, GPU donanımında **%70'e varan indirim** sunar. Ancak durumsuz (stateless) LLM çıkarım motorlarını Spot sunucularda çalıştırmak, kullanıcı isteklerini kesintiye uğratmadan ani donanım geri çağırmalarını (preemption) karşılayabilecek bir orkestrasyon katmanı gerektirir.

---

## 2. 2 Dakikalık Sonlandırma Uyarısı Mimarisi
Bulut sağlayıcıları, Spot sunucuları geri almadan 120 saniye önce bir kesinti uyarısı yayınlar. Esnek bir çıkarım filosu, bu olayı yakalamak için AWS Node Termination Handler veya Kubernetes Event Exporter kullanır:

```
[AWS CloudWatch Olayı] ──> [Spot Kesinti Uyarısı: 120 sn kaldı]
                                      │
                                      ▼
                        [Kubernetes Düğümü İzolasyonu (Cordon)]
                                      │
                                      ▼
                  [Giriş Ağ Geçidi Yeni İstekleri Yeniden Yönlendirir]
                                      │
                                      ▼
                  [Aktif vLLM Motoru Devam Eden Token'ları Tamamlar]
                                      │
                                      ▼
                        [Düğüm Güvenle Kapatılır]
```

---

## 3. vLLM Çıkarım Motoru Optimizasyonu
Dolar başına GPU verimini en üst düzeye çıkarmak için çıkarım çalışma zamanları PagedAttention ve sürekli toplu işlemeyi (continuous batching) uygulamalıdır:
- **PagedAttention:** KV-cache bellek parçalanmasını ortadan kaldırarak tek bir GPU üzerinde 2 ila 4 kat daha büyük parti boyutlarına olanak tanır.
- **Spekülatif Kod Çözme (Speculative Decoding):** Token önermek için CPU veya ekonomik GPU üzerinde çalışan küçük ve hızlı bir taslak model (örneğin Llama-3.2-1B) kullanır; hedef model (Llama-3.1-70B) bunları tek bir ileri geçişte doğrular ve 2.2 kat daha hızlı çıkarım sağlar.
- **Kuantalama:** FP8 veya AWQ 4-bit ağırlıkları VRAM kullanımını %50-%75 azaltarak modellerin \$8.00/saatlik A100 yerine \$1.00/saatlik L4 GPU'ya sığmasını sağlar.

```bash
# PagedAttention ve FP8 KV-Cache ile Canlı Ortam vLLM Başlatma Komutu
vllm serve meta-llama/Llama-3.1-8B-Instruct \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.92 \
  --max-model-len 8192 \
  --kv-cache-dtype fp8 \
  --enable-chunked-prefill \
  --port 8000
```

---

## 4. Çok Bölgeli (Multi-Region) Spot Yedekleme Politikası
`us-east-1` bölgesinde belirli bir GPU ailesi için Spot kapasitesi tükendiğinde, otomatik ölçeklendirme motoru kademeli olarak geri çekilmelidir:
1. İkincil Spot GPU örnek ailelerini deneyin (örneğin g5.xlarge'dan g6e.xlarge veya L4'e geçiş).
2. Eşlenmiş VPC'ler üzerinden bölgeler arası Spot yerleşimini deneyin.
3. Spot kapasitesi yeniden açılana kadar gecikme SLA'larını korumak için asgari On-Demand taban kapasitesine geçin.

```json
{
  "@context": "https://schema.org",
  "@type": "TechArticle",
  "headline": "Bölüm 4: Spot Preemptible GPU Yönetimi ve vLLM Çıkarımı",
  "description": "2 dakikalık Spot sonlandırma yönetimi, vLLM PagedAttention, spekülatif kod çözme ve çok bölgeli GPU yedekleme.",
  "url": "https://tinycto.tv/tr/cloud-economics/manuals/04-spot-gpu-yonetimi",
  "inLanguage": "tr-TR",
  "author": {
    "@type": "Organization",
    "name": "TinyCTO.tv",
    "url": "https://tinycto.tv"
  },
  "publisher": {
    "@type": "Organization",
    "name": "TinyCTO.tv",
    "url": "https://tinycto.tv"
  }
}
```
