ÖZET VE TEKNİK CEVAP
NVIDIA Multi-Instance GPU (MIG) veya GPU sanallaştırması ile devasa A100/H100 kartlarını müstakil bellek, işlem çekirdeği ve QoS garantisine sahip 7 adede kadar donanımsal parçaya bölerek; birden fazla hafif model ve embedding servisini tek bir fiziksel kartta güvenle çalıştırarak.
Mühendislik El Kitabı & Mekanizma
1. Temel Çalışma Mekanizması
Modern bulut GPU'ları (NVIDIA A100 80GB veya H100) saatte 3,50$-8,00$ arasındadır. Hafif iş yükleri (metin embedding, Whisper ses deşifre, BERT sıralama) GPU'nun nadiren %10-15'inden fazlasını kullanır. Geleneksel yazılımsal zaman paylaşımı (time-slicing) bellek yalıtımı sunamaz ve gecikme patlamaları yaşatır. NVIDIA MIG, GPU'yu silikon seviyesinde 7 bağımsız donanımsal örneğe böler; her parçaya özel bellek, önbellek ve çekirdek vererek komşu çekişmesini (noisy neighbor) sıfırlar.
2. Doğru Kullanım Senaryosu
Çok modelli çıkarım boru hatları, embedding servisleri, gerçek zamanlı ses/görüntü işleme ve Kubernetes üzerinde çok kiracılı yapay zeka platformları işleten ekipler için zorunludur.
3. Prodüksiyon Arıza Modları
Bir girişim 20 ayrı yapay zeka mikroservisi çalıştırır. Her servise ayrı bir `g5.xlarge` veya tam `p4d.24xlarge` GPU sunucusu tahsis edilir. Aylık GPU faturası 65.000 dolara fırlar; ancak telemetri verileri filonun ortalama GPU doluluk oranının sadece %4,2 olduğunu gösterir.
4. Teşhis ve Telemetri Sinyalleri
1. NVIDIA DCGM metriklerinde `GPU_UTIL` oranının sürekli %20'nin altında ve belleğin %80 boş kalması. 2. Eklenen her yeni makine öğrenimi servisiyle GPU faturalarının doğrusal katlanması. 3. Donanımsal bölümleme olmayan GPU'da hafif modeller aynı anda çalışırken OOM çökmelerinin yaşanması.
5. Önleme ve Mimari Bariyerler
1. Kubernetes üzerinde dinamik MIG profilleri (`1g.10gb` veya `2g.20gb`) tanımlayan NVIDIA GPU Operator kurun. 2. Dinamik model çoklama destekli Triton Inference Server veya vLLM kullanın. 3. Çıkarım Başına GPU Maliyetini (Cost-per-Inference) izleyen FinOps panelleri oluşturun.
6. Mimari Ödünleşimler (Trade-offs)
MIG yapılandırması özel Kubernetes daemonset'leri gerektirir ve her dilimi sabit bir donanım sınırına kilitler; buna karşılık kurumsal GPU filosu giderlerini %60-80 oranında düşürür.
Vaka İncelemesi (TinyCTO Örneği)
TinyCTO, 14 farklı dil ve görsel embedding modelini 14 adet müstakil AWS `g5.2xlarge` sunucusunda çalıştırıyordu (12.100$/ay). Kubernetes altında 14 adet `1g.10gb` MIG dilimine bölünmüş tek bir çoklu A100 sunucusuna geçildi. 14 servisin tamamı 15 ms altı garantili p99 gecikmeyle çalışırken aylık masraf 4.400 dolara geriledi (yılda 92.400$ tasarruf).
İnteraktif Konsept Alıştırmaları
3 AlıştırmaNVIDIA A100 MIG teknolojisi tek bir GPU'da en fazla kaç donanımsal bölmeyi destekler?
Çok kiracılı yapay zeka çıkarımında donanımsal MIG neden yazılımsal zaman paylaşımına (time-slicing) göre üstündür?
GPU altyapısının atıl kaldığını hangi telemetri metriği gösterir?
GPU Bölümleme, Çoklu Bulut GPU (MIG) & vGPU Altyapı Ekonomisi — Sıkça Sorulan Sorular
NVIDIA T4 veya L4 gibi daha küçük GPU'lar MIG teknolojisini destekler mi?
Hayır; MIG yalnızca NVIDIA Ampere ve Hopper kurumsal GPU'larında (A100, A30, H100, H200) desteklenir; küçük GPU'lar vGPU veya time-slicing kullanır.
Tek bir MIG dilimi yapay zeka model eğitimi için kullanılabilir mi?
Evet, hafif ince ayar (LoRA / QLoRA) veya küçük modeller için kullanılabilir; ancak büyük temel model ön eğitimi tam ve bölümlenmemiş çoklu GPU kümeleri gerektirir.
Triton Inference Server GPU ekonomisini nasıl iyileştirir?
Triton gelen çıkarım isteklerini dinamik olarak paketler (batching) ve birden fazla modeli mevcut GPU çekirdeklerine ve MIG dilimlerine eşzamanlı dağıtır.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸Hafif modeller için tam kurumsal GPU'ları (saatte 4$) bölmeden tahsis etmek modern yapay zeka mühendisliğindeki en büyük israf kaynağıdır.
- ▸NVIDIA MIG garantili gecikme SLA'sı ve bellek yalıtımı sağlayarak 7 bağımsız canlı iş yükünün tek 1 kartı paylaşmasına olanak tanır.
Yaygın Yanılgılar
- ✗Her yapay zeka mikroservisinin AWS veya GCP'de kendine ait müstakil bir GPU sunucusuna ihtiyaç duyduğunu sanmak.
Karar Kılavuzu & Önceliklendirme
Tüm A100/H100 kümelerinde MIG profilli NVIDIA GPU Operator kurun ve hafif embedding/çıkarım modellerini derhal ortak kartlarda birleştirin.
Doğrulanmış Kaynaklar & Referanslar
- [OFFICIAL-DOC]NVIDIA Multi-Instance GPU (MIG) User Guide & Architecture— NVIDIA Corporation
- [OFFICIAL-DOC]NVIDIA GPU Operator on Kubernetes Documentation— NVIDIA Corporation
