Skip to main content

> gpu_bölümleme,_çoklu_bulut_gpu_(mig)_&_vgpu_altyapı_ekonomisi

GPU Bölümleme, Çoklu Bulut GPU (MIG) & vGPU Altyapı Ekonomisi

Mühendislik ekipleri yapay zeka çıkarım (inference) GPU doluluk oranını %15'ten %85'e çıkararak makine öğrenimi altyapı harcamalarını nasıl %70 oranında azaltır?

Stack: FINOPS INFRASTRUCTURE STACKStaff/Principal (L6+)architectural-primitive

ÖZET VE TEKNİK CEVAP

NVIDIA Multi-Instance GPU (MIG) veya GPU sanallaştırması ile devasa A100/H100 kartlarını müstakil bellek, işlem çekirdeği ve QoS garantisine sahip 7 adede kadar donanımsal parçaya bölerek; birden fazla hafif model ve embedding servisini tek bir fiziksel kartta güvenle çalıştırarak.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

Modern bulut GPU'ları (NVIDIA A100 80GB veya H100) saatte 3,50$-8,00$ arasındadır. Hafif iş yükleri (metin embedding, Whisper ses deşifre, BERT sıralama) GPU'nun nadiren %10-15'inden fazlasını kullanır. Geleneksel yazılımsal zaman paylaşımı (time-slicing) bellek yalıtımı sunamaz ve gecikme patlamaları yaşatır. NVIDIA MIG, GPU'yu silikon seviyesinde 7 bağımsız donanımsal örneğe böler; her parçaya özel bellek, önbellek ve çekirdek vererek komşu çekişmesini (noisy neighbor) sıfırlar.

2. Doğru Kullanım Senaryosu

Çok modelli çıkarım boru hatları, embedding servisleri, gerçek zamanlı ses/görüntü işleme ve Kubernetes üzerinde çok kiracılı yapay zeka platformları işleten ekipler için zorunludur.

3. Prodüksiyon Arıza Modları

Bir girişim 20 ayrı yapay zeka mikroservisi çalıştırır. Her servise ayrı bir `g5.xlarge` veya tam `p4d.24xlarge` GPU sunucusu tahsis edilir. Aylık GPU faturası 65.000 dolara fırlar; ancak telemetri verileri filonun ortalama GPU doluluk oranının sadece %4,2 olduğunu gösterir.

4. Teşhis ve Telemetri Sinyalleri

1. NVIDIA DCGM metriklerinde `GPU_UTIL` oranının sürekli %20'nin altında ve belleğin %80 boş kalması. 2. Eklenen her yeni makine öğrenimi servisiyle GPU faturalarının doğrusal katlanması. 3. Donanımsal bölümleme olmayan GPU'da hafif modeller aynı anda çalışırken OOM çökmelerinin yaşanması.

5. Önleme ve Mimari Bariyerler

1. Kubernetes üzerinde dinamik MIG profilleri (`1g.10gb` veya `2g.20gb`) tanımlayan NVIDIA GPU Operator kurun. 2. Dinamik model çoklama destekli Triton Inference Server veya vLLM kullanın. 3. Çıkarım Başına GPU Maliyetini (Cost-per-Inference) izleyen FinOps panelleri oluşturun.

6. Mimari Ödünleşimler (Trade-offs)

MIG yapılandırması özel Kubernetes daemonset'leri gerektirir ve her dilimi sabit bir donanım sınırına kilitler; buna karşılık kurumsal GPU filosu giderlerini %60-80 oranında düşürür.

Vaka İncelemesi (TinyCTO Örneği)

TinyCTO, 14 farklı dil ve görsel embedding modelini 14 adet müstakil AWS `g5.2xlarge` sunucusunda çalıştırıyordu (12.100$/ay). Kubernetes altında 14 adet `1g.10gb` MIG dilimine bölünmüş tek bir çoklu A100 sunucusuna geçildi. 14 servisin tamamı 15 ms altı garantili p99 gecikmeyle çalışırken aylık masraf 4.400 dolara geriledi (yılda 92.400$ tasarruf).

İnteraktif Konsept Alıştırmaları

3 Alıştırma
Q1

NVIDIA A100 MIG teknolojisi tek bir GPU'da en fazla kaç donanımsal bölmeyi destekler?

7 adede kadar bağımsız donanımsal GPU örneği (örneğin 80GB A100 üzerinde yedi adet `1g.10gb` dilimi).
Q2

Çok kiracılı yapay zeka çıkarımında donanımsal MIG neden yazılımsal zaman paylaşımına (time-slicing) göre üstündür?

MIG gerçek fiziksel bellek yalıtımı sunar; bir modeldeki bellek sızıntısı veya çökme aynı GPU'daki diğer modelleri kesinlikle etkilemez.
Q3

GPU altyapısının atıl kaldığını hangi telemetri metriği gösterir?

`DCGM_FI_DEV_GPU_UTIL` (GPU işlemci doluluğu) ve `DCGM_FI_DEV_FB_USED` (kullanılan VRAM miktarı) metrikleridir.

GPU Bölümleme, Çoklu Bulut GPU (MIG) & vGPU Altyapı Ekonomisi — Sıkça Sorulan Sorular

NVIDIA T4 veya L4 gibi daha küçük GPU'lar MIG teknolojisini destekler mi?

Hayır; MIG yalnızca NVIDIA Ampere ve Hopper kurumsal GPU'larında (A100, A30, H100, H200) desteklenir; küçük GPU'lar vGPU veya time-slicing kullanır.

Tek bir MIG dilimi yapay zeka model eğitimi için kullanılabilir mi?

Evet, hafif ince ayar (LoRA / QLoRA) veya küçük modeller için kullanılabilir; ancak büyük temel model ön eğitimi tam ve bölümlenmemiş çoklu GPU kümeleri gerektirir.

Triton Inference Server GPU ekonomisini nasıl iyileştirir?

Triton gelen çıkarım isteklerini dinamik olarak paketler (batching) ve birden fazla modeli mevcut GPU çekirdeklerine ve MIG dilimlerine eşzamanlı dağıtır.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • Hafif modeller için tam kurumsal GPU'ları (saatte 4$) bölmeden tahsis etmek modern yapay zeka mühendisliğindeki en büyük israf kaynağıdır.
  • NVIDIA MIG garantili gecikme SLA'sı ve bellek yalıtımı sağlayarak 7 bağımsız canlı iş yükünün tek 1 kartı paylaşmasına olanak tanır.

Yaygın Yanılgılar

  • Her yapay zeka mikroservisinin AWS veya GCP'de kendine ait müstakil bir GPU sunucusuna ihtiyaç duyduğunu sanmak.

Karar Kılavuzu & Önceliklendirme

Tüm A100/H100 kümelerinde MIG profilli NVIDIA GPU Operator kurun ve hafif embedding/çıkarım modellerini derhal ortak kartlarda birleştirin.

Doğrulanmış Kaynaklar & Referanslar