Skip to main content

> gpu_küme_verimsizliği_ve_paylaşımlı_kaynak_dağıtımı

GPU Küme Verimsizliği ve Paylaşımlı Kaynak Dağıtımı

H100 ve A100 GPU kümeleri neden sıklıkla sadece %20 işlem verimliliğiyle çalışır ve dinamik fraksiyonel paylaştırma bunu nasıl çözer?

Stack: AI STACKStaff+ (L6+)tradeoff

ÖZET VE TEKNİK CEVAP

Çünkü yapay zeka mühendisleri interaktif Jupyter notebook'lar ve basit çıkarım API'ları için ayda 30.000 dolarlık 8xGPU sunucularını rezerve eder; MIG ve zaman dilimleme tek bir GPU'yu izole parçalara bölerek verimi maksimize eder.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

NVIDIA Multi-Instance GPU (MIG), tek bir A100/H100 çipini ayrılmış bellek ve çekirdeğe sahip 7 bağımsız donanım parçasına böler. Kubernetes GPU operatörleri birden çok hafif iş yükünü aynı fiziksel çipe güvenle yerleştirir.

2. Doğru Kullanım Senaryosu

Kurumsal yapay zeka platformları, model ince ayar (fine-tuning) kuyrukları, LLM çıkarım servisleri ve geliştirici ortamları için zorunludur.

3. Prodüksiyon Arıza Modları

8 geliştirici için günde sadece 2 saat prompt testi yaptıkları halde 16 adet H100 sunucusunun ($45.000/ay) 7/24 açık tutulması ve ayda 35.000 doların boşta yanan çiplere gitmesi.

4. Teşhis ve Telemetri Sinyalleri

Prometheus üzerinde NVIDIA DCGM metriklerini (`DCGM_FI_DEV_GPU_UTIL`) izleyerek gerçek donanım kullanım yüzdelerini ölçün.

5. Önleme ve Mimari Bariyerler

Run:ai veya Karpenter GPU otomatik ölçekleme kurarak 15 dakika boşta kalan GPU ortamlarını otomatik kapatın.

6. Mimari Ödünleşimler (Trade-offs)

GPU paylaştırma maliyeti %70 düşürür ancak OOM çökmelerini önlemek için CUDA bellek sınırlarının dikkatli yönetilmesini gerektirir.

Vaka İncelemesi (TinyCTO Örneği)

Bir otonom sürüş girişimi 32 adet A100 GPU'yu MIG ile bölerek daha önce 32 iş çalıştıran altyapıda 90 eşzamanlı modeli çalıştırdı ve ayda 28.000 dolar tasarruf etti.

İnteraktif Konsept Alıştırmaları

3 Alıştırma
Q1

NVIDIA Multi-Instance GPU (MIG) nedir?

Tek bir A100/H100 çipini donanımsal olarak izole edilmiş ve kendine ait belleği olan 7 ayrı GPU parçasına bölen teknolojidir.
Q2

Yapay zeka çıkarımında düşük GPU verimliliğinin temel sebebi nedir?

Bellek bant genişliği darboğazları ve toplu yapılmayan (unbatched) isteklerin Tensor çekirdeklerini boşta bekletmesidir.
Q3

vLLM veya TensorRT-LLM içinde sürekli toplu işleme (continuous batching) nedir?

Yeni gelen istekleri dinamik olarak çalışan GPU döngüsüne ekleyerek verimi 3 ila 5 kat artıran optimizasyon algoritmasıdır.

GPU Küme Verimsizliği ve Paylaşımlı Kaynak Dağıtımı — Sıkça Sorulan Sorular

Donanımsal MIG desteği olmayan eski GPU'lar paylaştırılabilir mi?

Evet, Kubernetes üzerinde yazılımsal zaman dilimleme (time-slicing) ile paylaştırılabilir; ancak katı bellek izolasyonu olmaz.

İsteğe bağlı ile Spot GPU sunucuları arasındaki fiyat farkı nedir?

Spot GPU'lar standart saatlik liste fiyatına kıyasla %60 ila %75 indirim sağlar.

İnteraktif Jupyter notebook'lar 7/24 özel GPU sunucularında açık bırakılmalı mıdır?

Hayır; notebook'lar normal CPU sunucuda açılmalı, GPU'ya yalnızca model çalıştırma anında bağlanmalıdır.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • GPU donanımı modern yapay zeka mühendisliğindeki en pahalı kalemdir; bölünmemiş atıl GPU çalıştırmak doğrudan nakit israfıdır.

Yaygın Yanılgılar

  • Küçük bir embedding modeli çalıştıran her mikroservisin tam boyutlu bir A100 GPU'ya ihtiyacı olduğunu sanmak.

Karar Kılavuzu & Önceliklendirme

Kubernetes GPU havuzlarında NVIDIA MIG veya time-slicing uygulayın ve 15 dakika boşta kalan ortamları otomatik kapatın.

Doğrulanmış Kaynaklar & Referanslar

İlgili Kavramlar