ÖZET VE TEKNİK CEVAP
Derin öğrenme modelleri ve LLM ince ayarı (fine-tuning) yapmak devasa GPU kümeleri gerektirir (8'li NVIDIA H100 veya A100 `p4de.24xlarge` / `p5.48xlarge`). 8 GPU'lu tek bir sunucuyu AWS On-Demand çalıştırmak **saatte $32,77 ila $98,32 (sunucu başı ayda $23.600 ila $70.800)** tutar. Buna karşılık **AWS EC2 Spot Sunucuları** birebir aynı donanımı **%60 ila %75 indirimle (saatte $8-$24)** sunar. Buradaki ölümcül engel **Spot Kesintisidir (Preemption)**: AWS talep arttığında Spot sunucuyu 2 dakikalık bir uyarıyla anında geri alabilir. 3 günlük bir model eğitimi 48. epoch'ta kesintiye uğrar ve kaydedilmemişse, binlerce dolarlık GPU işlem gücü ve günler süren çalışma çöpe gider. Canlı yapay zeka platformları bunu **Hata Toleranslı Kurtarma Mimarileri** ile çözer: (1) PyTorch FSDP ile her 15 dakikada bir model ağırlıklarını asenkron olarak S3'e kaydetmek (Checkpointing), (2) AWS'in 2 dakikalık kesinti uyarısını yakalayıp son durumu kaydetmek, ve (3) Ray/Kubernetes ile eğitimi başka bir Spot sunucuda otomatik olarak kaldığı adımdan devam ettirmek.
Mühendislik El Kitabı & Mekanizma
1. Temel Çalışma Mekanizması
GPU Spot hata dayanıklılığı 4 aşamalı bir yaşam döngüsüyle çalışır: (1) Mikro-Checkpointing: PyTorch dağıtık eğitimcisi model ağırlıklarını yerel NVMe diske kaydeder ve asenkron olarak Amazon S3'e yükler. (2) 2 Dakika Uyarısı Yakalama: Bir yan süreç EC2 Instance Metadata servisini (`spot/instance-action`) sürekli yoklar. (3) Acil Kayıt: Kesinti sinyali geldiğinde eğitim script'ine `SIGUSR1` sinyali atılarak 60 saniye içinde acil bir son checkpoint kaydedilir. (4) Ray Kümesiyle Otomatik Devam: Ray orkestratörü düşen düğümü tespit eder, başka bir bölgeden veya alternatif GPU tipinden yeni bir Spot sunucu açarak eğitimi son checkpoint dosyasından kaldığı adımdan otomatik devam ettirir.
2. Doğru Kullanım Senaryosu
Büyük Dil Modeli (LLM) eğitimi ve ince ayarı, bilgisayarla görü model eğitimleri, difüzyon görsel üretim hatları ve dağıtık RLHF eğitim süreçleri.
3. Prodüksiyon Arıza Modları
Checkpoint'leri sadece 8 saatte bir kaydedip Spot kesintisinde 7,5 saatlik pahalı GPU emeğini kaybetmek; 50 GB'lık model dosyalarını senkron olarak S3'e yazmaya çalışıp her kayıtta GPU'ları 10 dakika boyunca boşta dondurmak.
4. Teşhis ve Telemetri Sinyalleri
Yapay zeka bulut faturalarında tüm GPU'ların en pahalı On-Demand tarifesinden çalıştığının görülmesi; sunucu kesintisi sonrası eğitimlerin manuel olarak en baştan (0. adımdan) başlatılması.
5. Önleme ve Mimari Bariyerler
Asenkron S3 checkpoint desteğine sahip Ray Train veya PyTorch Lightning kullanın; çoklu bölge ve farklı GPU ailelerinden oluşan Spot havuzları tanımlayın; AWS EventBridge ile erken kesinti alarmlarını otomasyona bağlayın.
6. Mimari Ödünleşimler (Trade-offs)
GPU Spot kullanımı eğitim altyapı maliyetini %65-75 oranında düşürür; ancak sunucu el değiştirmesi sırasında model eğitiminde 2-5 dakikalık geçici duraklamalar yaratır.
Vaka İncelemesi (TinyCTO Örneği)
Bir yapay zeka girişimi 70 milyar parametreli açık kaynaklı bir LLM modelini 4 sunuculuk 8x A100 GPU kümesinde (`p4d.24xlarge`) eğitiyordu. AWS On-Demand ile 14 günlük eğitimin maliyeti $44.000 olarak hesaplanmıştı. Ekip Ray Train kullanarak 15 dakikada bir asenkron S3 checkpoint alan ve kesintileri otomatik yöneten bir Spot boru hattı kurdu. 14 gün boyunca sistem 6 kez Spot kesintisi yaşadı; her biri 3 dakikadan kısa sürede kaldığı adımdan otomatik devam etti. Toplam eğitim maliyeti $44.000'den $12.800'e gerileyerek tek bir model eğitiminde şirkete $31.200 net tasarruf sağladı.
İnteraktif Konsept Alıştırmaları
2 AlıştırmaGPU model eğitimlerinde AWS Spot Sunucuları kullanmanın temel finansal avantajı nedir?
AWS bir EC2 Spot sunucusunu geri almadan önce ne kadar süre önceden uyarı verir?
Yapay Zeka İşlem Gücü Ekonomisi: GPU Spot Kesinti Dayanıklılığı ve Checkpoint Kurtarma Hatları — Sıkça Sorulan Sorular
Checkpoint kaydetme işleminin aktif GPU model eğitimini yavaşlatması nasıl önlenir?
Ağırlıkları önce yerel hızlı NVMe diske yazıp, GPU'yu hiç bekletmeden arka plandaki ayrı bir CPU iş parçacığıyla asenkron olarak Amazon S3'e yükleyerek.
Hangi orkestrasyon çatıları yapay zeka eğitiminde yerleşik Spot kesinti kurtarma desteği sunar?
Ray Train, PyTorch Lightning, otomatik kuyruk destekli Slurm ve SkyPilot.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸GPU Spot sunucuları pahalı A100/H100 yapay zeka donanımlarında %60-75 indirim sunar.
- ▸AWS, Spot sunucuyu geri almadan önce 2 dakikalık resmi kesinti uyarısı verir.
- ▸Eğitim adımlarının kaybolmaması için 15 dakikada bir asenkron S3 checkpoint kaydı alın.
- ▸Çok bölgeli Spot işçi kurtarmasını otomatikleştirmek için Ray Train veya PyTorch FSDP kullanın.
Yaygın Yanılgılar
- ✗Yanılgı: Spot sunucular model eğitimi için çok güvensizdir (Gerçek: Otomatik checkpoint ve Ray ile kesintiler sadece 2 dakikalık otomatik duraklamalara dönüşür).
- ✗Yanılgı: Checkpoint sadece her epoch'un sonunda kaydedilmelidir (Gerçek: Büyük verilerde bir epoch 20 saat sürebilir; adım bazlı olarak her 15-30 dakikada bir kayıt alınmalıdır).
Karar Kılavuzu & Önceliklendirme
Kurumsal LLM eğitimi ve ince ayar altyapı maliyetlerini %70'in üzerinde düşürmek için GPU Spot sunucularında asenkron S3 checkpointing kullanan Ray Train mimarisini uygulayın.
Doğrulanmış Kaynaklar & Referanslar
- [OFFICIAL_DOCUMENTATION]Training Deep Learning Models at Scale on AWS EC2 Spot Instances— Amazon Web Services Architecture Blog
