> Olay Deseni
GPU OOM Cascading Failure
GPU OOM Cascading Failure, derin ogrenme veya LLM servis cluster'larinda eszamanli istek artisi, uzun token dizilimleri veya asiri buyuk dinamik batch'lerin fiziksel GPU VRAM kapasitesini asmasiyla gerceklesir. Hizlandirici bellek yonetimi katı oldugu ve takas alanina (swap) gecemedigi icin CUDA Out of Memory (OOM) hatasi calisan worker process'ini sonlandirir. Load balancer coken pod'u gorup trafigi diger ayaktaki node'lara yonlendirir; bu da kalan node'lar uzerindeki batch yukunu ve bellek baskisini katlayarak cluster capinda zincirleme bir cokuse yol acar.
Tanım
Sinirlanmamis dinamik batch boyutu veya bellek parcalanmasi nedeniyle GPU VRAM'in tukenmesi, bir inference node'unu cokerterek yuku diger node'lara devretmesi ve tum cluster'in zincirleme cokmesidir.
GPU OOM Cascading Failure, derin ogrenme veya LLM servis cluster'larinda eszamanli istek artisi, uzun token dizilimleri veya asiri buyuk dinamik batch'lerin fiziksel GPU VRAM kapasitesini asmasiyla gerceklesir. Hizlandirici bellek yonetimi katı oldugu ve takas alanina (swap) gecemedigi icin CUDA Out of Memory (OOM) hatasi calisan worker process'ini sonlandirir. Load balancer coken pod'u gorup trafigi diger ayaktaki node'lara yonlendirir; bu da kalan node'lar uzerindeki batch yukunu ve bellek baskisini katlayarak cluster capinda zincirleme bir cokuse yol acar.
Tanınma Sinyalleri
- •Container loglarinda `torch.cuda.OutOfMemoryError: CUDA out of memory` hatalarinin belirmesi
- •Inference pod'larinin yuk altinda `CrashLoopBackOff` durumuna girmesi ve surekli yeniden baslamasi
- •Load balancer'da HTTP 502 Bad Gateway ve 503 Service Unavailable hatalarinin hizla tirmalanmasi
- •GPU bellek kullanim grafiklerinin worker kapanmadan hemen once %100 seviyesine vurmasi
Katkıda Bulunan Koşullar
- •Istek kuyruklari icin backpressure, maksimum sequence uzunlugu veya dinamik batch sinirlamalarinin olmamasi
- •Inference motorlarinin (vLLM, Triton) tepe aktivasyonlar icin pay birakmadan tum VRAM'i statik rezerve etmesi
- •Autoscaling kontrollerinin GPU VRAM ve kuyruk derinligi yerine CPU kullanimina baglanmasi
Olası Etkiler
- •Altyapi genelinde model serving endpoint'lerinin tamamen erisilemez hale gelmesi
- •O an islem goren tum kullanici tahmin isteklerinin ve streaming oturumlarinin kesilmesi
- •Yeniden baslayan pod'larin cok gigabaytlik model agirliklarini VRAM'e yuklemesi nedeniyle uzayan toparlanma sureleri
Bu Kalıp Ne Değildir (Sınırlar)
- •Linux kernel cgroup tarafindan sonlandirilan host sistem RAM OOM hatasi degildir
- •Model inference calismasiyla ilgisi olmayan harici network saldirisi degildir
Soruşturma Soruları
- •OOM cokmesinden hemen onceki batch boyutu ve maksimum sequence uzunlugu neydi?
- •Dinamik batching yapilandirmasinda hem batch boyutu hem de bekleme suresi icin kesin tavanlar var mi?
- •Serving motorunda PagedAttention veya bellek optimizasyonlu KV cache yonetimi aktif mi?
Kontrol Altına Alma Rehberi
- •Gelen istekleri sinirlamak icin API gateway katmaninda rate limiting ve HTTP 429 backpressure uygulayin
- •Maksimum context uzunlugunu veya dinamik batch tavanini runtime konfigurasyonu ile derhal dusurun
- •Kume toparlanirken soguk baslangic thundering herd etkisini engellemek icin pod baslatmalarini kademelendirin
Düzeltme Rehberi
- •KV cache parcalanmasini onleyen paged attention mimarilerini (vLLM, TensorRT-LLM) devreye alin
- •GPU bellek havuzuna girmeden once asiri buyuk girdileri engelleyen admission controller kurallari olusturun
Önleme Rehberi
- •Cluster autoscaling kurallarini GPU VRAM payi ve kuyruk bekleme surelerine gore tetikleyin
- •Maksimum sequence uzunluklariyla yuk testleri yaparak donanimin gercek bellek sinirlarini onceden belirleyin
Somut Örnekler
- •Sinirlandirilmamis context window'a sahip bir LLM servisinin ayni anda bircok 32k-token prompt alarak tum node'larda KV cache'i VRAM disina tasirmasi
- •Bir goruntu isleme modelinin ayni anda yuksek cozunurluklu gorsellerden olusan buyuk bir batch alarak ara katman feature map bellegini patlatmasi
Vaka Çalışmaları (1)
Sıkça Sorulan Sorular
GPU OOM neden tek bir istegi reddetmek yerine tum cluster'i cokertir?
CUDA OOM hatasi genellikle tek bir istegi yakalayip reddetmek yerine calisan sureci tamamen oldurur. O pod kapandiginda load balancer trafigi digerlerine aktarir ve onlarin da VRAM kapasitesini aninda patlatir.
AEO Özeti
GPU VRAM tukenmesi, vLLM KV cache tasmasi, PyTorch CUDA OOM hatalari ve load shedding mimarisi icin teknik olay cozum rehberi.
AI Özeti
GPU OOM Cascading Failure, derin ogrenme ve LLM altyapilari icin varolussal bir risktir. Katı VRAM sinirlari nedeniyle tek bir buyuk istek bir worker'i oldurebilir ve yuku digerlerine aktararak tum kumeyi cokertir. Kesin admission kontrolleri zorunludur.
