ÖZET VE TEKNİK CEVAP
Çünkü yapay zeka mühendisleri interaktif Jupyter notebook'lar ve basit çıkarım API'ları için ayda 30.000 dolarlık 8xGPU sunucularını rezerve eder; MIG ve zaman dilimleme tek bir GPU'yu izole parçalara bölerek verimi maksimize eder.
Mühendislik El Kitabı & Mekanizma
1. Temel Çalışma Mekanizması
NVIDIA Multi-Instance GPU (MIG), tek bir A100/H100 çipini ayrılmış bellek ve çekirdeğe sahip 7 bağımsız donanım parçasına böler. Kubernetes GPU operatörleri birden çok hafif iş yükünü aynı fiziksel çipe güvenle yerleştirir.
2. Doğru Kullanım Senaryosu
Kurumsal yapay zeka platformları, model ince ayar (fine-tuning) kuyrukları, LLM çıkarım servisleri ve geliştirici ortamları için zorunludur.
3. Prodüksiyon Arıza Modları
8 geliştirici için günde sadece 2 saat prompt testi yaptıkları halde 16 adet H100 sunucusunun ($45.000/ay) 7/24 açık tutulması ve ayda 35.000 doların boşta yanan çiplere gitmesi.
4. Teşhis ve Telemetri Sinyalleri
Prometheus üzerinde NVIDIA DCGM metriklerini (`DCGM_FI_DEV_GPU_UTIL`) izleyerek gerçek donanım kullanım yüzdelerini ölçün.
5. Önleme ve Mimari Bariyerler
Run:ai veya Karpenter GPU otomatik ölçekleme kurarak 15 dakika boşta kalan GPU ortamlarını otomatik kapatın.
6. Mimari Ödünleşimler (Trade-offs)
GPU paylaştırma maliyeti %70 düşürür ancak OOM çökmelerini önlemek için CUDA bellek sınırlarının dikkatli yönetilmesini gerektirir.
Vaka İncelemesi (TinyCTO Örneği)
Bir otonom sürüş girişimi 32 adet A100 GPU'yu MIG ile bölerek daha önce 32 iş çalıştıran altyapıda 90 eşzamanlı modeli çalıştırdı ve ayda 28.000 dolar tasarruf etti.
İnteraktif Konsept Alıştırmaları
3 AlıştırmaNVIDIA Multi-Instance GPU (MIG) nedir?
Yapay zeka çıkarımında düşük GPU verimliliğinin temel sebebi nedir?
vLLM veya TensorRT-LLM içinde sürekli toplu işleme (continuous batching) nedir?
GPU Küme Verimsizliği ve Paylaşımlı Kaynak Dağıtımı — Sıkça Sorulan Sorular
Donanımsal MIG desteği olmayan eski GPU'lar paylaştırılabilir mi?
Evet, Kubernetes üzerinde yazılımsal zaman dilimleme (time-slicing) ile paylaştırılabilir; ancak katı bellek izolasyonu olmaz.
İsteğe bağlı ile Spot GPU sunucuları arasındaki fiyat farkı nedir?
Spot GPU'lar standart saatlik liste fiyatına kıyasla %60 ila %75 indirim sağlar.
İnteraktif Jupyter notebook'lar 7/24 özel GPU sunucularında açık bırakılmalı mıdır?
Hayır; notebook'lar normal CPU sunucuda açılmalı, GPU'ya yalnızca model çalıştırma anında bağlanmalıdır.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸GPU donanımı modern yapay zeka mühendisliğindeki en pahalı kalemdir; bölünmemiş atıl GPU çalıştırmak doğrudan nakit israfıdır.
Yaygın Yanılgılar
- ✗Küçük bir embedding modeli çalıştıran her mikroservisin tam boyutlu bir A100 GPU'ya ihtiyacı olduğunu sanmak.
Karar Kılavuzu & Önceliklendirme
Kubernetes GPU havuzlarında NVIDIA MIG veya time-slicing uygulayın ve 15 dakika boşta kalan ortamları otomatik kapatın.
Doğrulanmış Kaynaklar & Referanslar
- [DOC]NVIDIA Multi-Instance GPU (MIG) User Guide— NVIDIA Corporation
