> tpl_air_022
LLM Ağ Geçidi (Gateway), Yönlendirme, Yedekleme ve Dayanıklılık Tasarımı
Birleşik API soyutlamasını, dinamik anlamsal maliyet/gecikme yönlendirmesini, çok sağlayıcılı otomatik yük devretmeyi (failover), token hız sınırlandırmasını, anlamsal önbelleğe almayı ve devre kesici (circuit breaker) desenlerini tanımlayarak LLM sağlayıcı kesintilerini ortadan kaldıran ve çıkarım maliyetlerini düşüren kurumsal yapay zekâ ağ geçidi mimarisi.
Çok sağlayıcılı yük devretmeyi, anlamsal önbelleğe almayı, maliyet yönlendirmesini ve devre kesicileri standartlaştıran kurumsal LLM ağ geçidi mimarisi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Uygulamalar doğrudan sağlayıcı API çağrılarını (ör. doğrudan OpenAI veya Anthropic) sabit kodlar; bu da canlı servisleri sağlayıcı hız limitlerine, HTTP 503 kesintilerine, kontrolsüz fatura artışlarına ve merkezi denetim günlüklerinin yokluğuna karşı savunmasız bırakır.
Ne Zaman Kullanılmalı?
- •Ticari veya açık kaynaklı LLM'leri kullanan birden fazla mühendislik ekibi genelinde merkezi model erişim altyapısı tasarlarken
- •Otomatik devre kesiciler ve model yedekleme zincirleri (ör. Claude 3.5 Sonnet -> GPT-4o -> Llama 3.3 70B) uygularken
- •Tekrarlayan çıkarım işletme giderlerini (OpEx) %30-50 azaltmak için anlamsal gömme önbellekleri ve token hız sınırlayıcıları devreye alırken
Ne Zaman Kullanılmamalı?
- •Temel modellerin kıyaslama değerlendirmelerinde ve istem kalite puanlamasında (TPL-AIR-020 kullanın)
- •Dahili veri kümelerinde özel alan modeli kontrol noktalarına ince ayar yaparken (TPL-AIR-023 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
İstemci uygulamalarını tescilli sağlayıcı SDK'larından ayıran ve OpenAI uyumlu /v1/chat/completions arayüzü sunan yüksek erişilebilirlikli ters proxy katmanı.
Yönlendirme mantığı: Basit sorguların küçük/hızlı modellere (GPT-4o-mini, Haiku 3.5), karmaşık akıl yürütmelerin öncü modellere (Claude 3.5 Sonnet, o1) yönlendirilmesi.
Otomatik devre kesiciler (Netflix Hystrix deseni): 10 saniye içinde peş peşe 3 adet HTTP 429/5xx hatasında devreyi açıp trafiği sıfır kesintiyle yedek sağlayıcıya aktarma.
Tekrarlayan istemlerde anında ve sıfır maliyetli yanıtlar dönmek için Redis veya Milvus üzerinde kosinüs benzerliği eşikli (>0,96) anlamsal önbellek kurulumu.
API anahtarı başına token-bucket hız sınırları, masraf merkezi başına aylık kesin harcama tavanları ve OpenTelemetry izlerinin merkezi panellere aktarımı.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
LLM Ağ Geçidi (Gateway), Yönlendirme, Yedekleme ve Dayanıklılık Tasarımı - Örnek Vaka Analizi
Örnek Organizasyon: Kurumsal Yapay Zekâ Platformu ve Üretken Mühendislik Grubu
Kurumsal Yapay Zekâ Platformu ve Üretken Mühendislik Grubu için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •22 ürün mikro servisi genelinde günlük 8,5 milyon token yönlendiren LiteLLM tabanlı yüksek erişilebilirlikli ağ geçidi kurdu
- •Büyük OpenAI kesintisi sırasında AWS Bedrock üzerindeki Anthropic modellerine anında geçiş yaparak %99,99 yapay zekâ erişilebilirliği sağladı
- •Anlamsal Redis önbelleği ve istem karmaşıklık sınıflandırıcısıyla aylık LLM çıkarım harcamalarını %44 düşürdü
Sıkça Sorulan Sorular
Bir kurum doğrudan SDK entegrasyonu yerine neden bir LLM Ağ Geçidi (Gateway) kullanmalıdır?
Ağ geçidi uygulamaları tescilli sağlayıcı API'lerinden ayırır. Merkezi API anahtarı yönetimi, birleşik token hız sınırlandırması, bütçe kontrolü, kesintilerde anında çok sağlayıcılı yük devretme ve onlarca dağınık mikro serviste yönetilmesi imkansız olan tek tip uyumluluk/denetim günlüğü sağlar.
Bir LLM Ağ Geçidinde anlamsal önbelleğe alma (semantic caching) nasıl çalışır?
Bir istem geldiğinde ağ geçidi bunun vektör gömmesini hesaplar ve vektör veritabanını (ör. Redis) kontrol eder. Daha önce yanıtlanmış bir istem yüksek benzerlik eşiğinin (ör. 0,96) üzerindeyse, dış LLM çağrılmadan önbellekteki yanıt dönülür; bu da 10 ms altı gecikme ve 0 dolar maliyet sağlar.
Devre kesici (circuit breaker) uygulamaları sağlayıcı kesintilerinden nasıl korur?
Bir LLM sağlayıcısında hız aşımı (HTTP 429) veya sunucu hataları (HTTP 503) yaşandığında, devre kesici belirlenen hata eşiğinde "devreyi açar". Çöken sağlayıcıyı sorgulamayı durdurur ve trafiği otomatik olarak ikincil modele (ör. Azure OpenAI'den AWS Bedrock'a) yönlendirerek zincirleme çökmeleri önler.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- OpenAI API Reference & Proxy SpecificationsOpenAI • OFFICIAL REQUIREMENT
- OWASP Top 10 for Large Language Model Applications (2025 Edition)OWASP • OFFICIAL REQUIREMENT
- Netflix Technology Blog: Fault Tolerance in a High Volume, Distributed SystemNetflix Engineering • OFFICIAL REQUIREMENT
