Skip to main content

> tpl_air_022

LLM Ağ Geçidi (Gateway), Yönlendirme, Yedekleme ve Dayanıklılık Tasarımı

Birleşik API soyutlamasını, dinamik anlamsal maliyet/gecikme yönlendirmesini, çok sağlayıcılı otomatik yük devretmeyi (failover), token hız sınırlandırmasını, anlamsal önbelleğe almayı ve devre kesici (circuit breaker) desenlerini tanımlayarak LLM sağlayıcı kesintilerini ortadan kaldıran ve çıkarım maliyetlerini düşüren kurumsal yapay zekâ ağ geçidi mimarisi.

TEMPLATE // INSPECT: TPL-AIR-022MODIFIED: 2026-09-19
KATEGORİÜretken Yapay Zekâ, RAG ve Ajanlar
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIDOC
FORMATLARDOCX, PDF, MD, MERMAID, SVG
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

Çok sağlayıcılı yük devretmeyi, anlamsal önbelleğe almayı, maliyet yönlendirmesini ve devre kesicileri standartlaştıran kurumsal LLM ağ geçidi mimarisi.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Uygulamalar doğrudan sağlayıcı API çağrılarını (ör. doğrudan OpenAI veya Anthropic) sabit kodlar; bu da canlı servisleri sağlayıcı hız limitlerine, HTTP 503 kesintilerine, kontrolsüz fatura artışlarına ve merkezi denetim günlüklerinin yokluğuna karşı savunmasız bırakır.

Ne Zaman Kullanılmalı?

  • Ticari veya açık kaynaklı LLM'leri kullanan birden fazla mühendislik ekibi genelinde merkezi model erişim altyapısı tasarlarken
  • Otomatik devre kesiciler ve model yedekleme zincirleri (ör. Claude 3.5 Sonnet -> GPT-4o -> Llama 3.3 70B) uygularken
  • Tekrarlayan çıkarım işletme giderlerini (OpEx) %30-50 azaltmak için anlamsal gömme önbellekleri ve token hız sınırlayıcıları devreye alırken

Ne Zaman Kullanılmamalı?

  • Temel modellerin kıyaslama değerlendirmelerinde ve istem kalite puanlamasında (TPL-AIR-020 kullanın)
  • Dahili veri kümelerinde özel alan modeli kontrol noktalarına ince ayar yaparken (TPL-AIR-023 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Birleşik API Soyutlaması ve Mimari Topolojistandard, enterprise

İstemci uygulamalarını tescilli sağlayıcı SDK'larından ayıran ve OpenAI uyumlu /v1/chat/completions arayüzü sunan yüksek erişilebilirlikli ters proxy katmanı.

Yönerge:Uygulama mikro servislerinin ham sağlayıcı SDK'larını doğrudan kullanmasına asla izin vermeyin; ağ geçidinden geçişi zorunlu kılın.
2. 2. Dinamik Yönlendirme Algoritmaları: Maliyet, Gecikme ve Yetenekstandard, enterprise

Yönlendirme mantığı: Basit sorguların küçük/hızlı modellere (GPT-4o-mini, Haiku 3.5), karmaşık akıl yürütmelerin öncü modellere (Claude 3.5 Sonnet, o1) yönlendirilmesi.

Yönerge:Rutin özetleme ve veri çıkarma işlerinde %60'a varan tasarruf sağlamak için sınıflandırıcı tabanlı yönlendirme kullanın.
3. 3. Çok Sağlayıcılı Yedekleme ve Devre Kesici Dayanıklılığıstandard, enterprise

Otomatik devre kesiciler (Netflix Hystrix deseni): 10 saniye içinde peş peşe 3 adet HTTP 429/5xx hatasında devreyi açıp trafiği sıfır kesintiyle yedek sağlayıcıya aktarma.

Yönerge:Gecikmeli üstel geri çekilme (backoff with jitter) uygulayın ve bulutlar arası yedeklilik (AWS Bedrock + Azure OpenAI) sağlayın.
4. 4. Anlamsal Önbelleğe Alma ve Token Tekilleştirmestandard, enterprise

Tekrarlayan istemlerde anında ve sıfır maliyetli yanıtlar dönmek için Redis veya Milvus üzerinde kosinüs benzerliği eşikli (>0,96) anlamsal önbellek kurulumu.

Yönerge:Yalnızca deterministik sorguları önbelleğe alın; kişiselleştirilmiş gerçek zamanlı oturumlarda önbelleği kesinlikle baypas edin.
5. 5. Hız Sınırlandırma, Harcama Bariyerleri ve Birleşik Telemetristandard, enterprise

API anahtarı başına token-bucket hız sınırları, masraf merkezi başına aylık kesin harcama tavanları ve OpenTelemetry izlerinin merkezi panellere aktarımı.

Yönerge:Aylık bütçenin %95'ine ulaşıldığında acil olmayan toplu işleri reddeden sert faturalandırma devre kesicileri uygulayın.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

LLM Ağ Geçidi (Gateway), Yönlendirme, Yedekleme ve Dayanıklılık Tasarımı - Örnek Vaka Analizi

Örnek Organizasyon: Kurumsal Yapay Zekâ Platformu ve Üretken Mühendislik Grubu

Kurumsal Yapay Zekâ Platformu ve Üretken Mühendislik Grubu için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • 22 ürün mikro servisi genelinde günlük 8,5 milyon token yönlendiren LiteLLM tabanlı yüksek erişilebilirlikli ağ geçidi kurdu
  • Büyük OpenAI kesintisi sırasında AWS Bedrock üzerindeki Anthropic modellerine anında geçiş yaparak %99,99 yapay zekâ erişilebilirliği sağladı
  • Anlamsal Redis önbelleği ve istem karmaşıklık sınıflandırıcısıyla aylık LLM çıkarım harcamalarını %44 düşürdü

Sıkça Sorulan Sorular

Bir kurum doğrudan SDK entegrasyonu yerine neden bir LLM Ağ Geçidi (Gateway) kullanmalıdır?

Ağ geçidi uygulamaları tescilli sağlayıcı API'lerinden ayırır. Merkezi API anahtarı yönetimi, birleşik token hız sınırlandırması, bütçe kontrolü, kesintilerde anında çok sağlayıcılı yük devretme ve onlarca dağınık mikro serviste yönetilmesi imkansız olan tek tip uyumluluk/denetim günlüğü sağlar.

Bir LLM Ağ Geçidinde anlamsal önbelleğe alma (semantic caching) nasıl çalışır?

Bir istem geldiğinde ağ geçidi bunun vektör gömmesini hesaplar ve vektör veritabanını (ör. Redis) kontrol eder. Daha önce yanıtlanmış bir istem yüksek benzerlik eşiğinin (ör. 0,96) üzerindeyse, dış LLM çağrılmadan önbellekteki yanıt dönülür; bu da 10 ms altı gecikme ve 0 dolar maliyet sağlar.

Devre kesici (circuit breaker) uygulamaları sağlayıcı kesintilerinden nasıl korur?

Bir LLM sağlayıcısında hız aşımı (HTTP 429) veya sunucu hataları (HTTP 503) yaşandığında, devre kesici belirlenen hata eşiğinde "devreyi açar". Çöken sağlayıcıyı sorgulamayı durdurur ve trafiği otomatik olarak ikincil modele (ör. Azure OpenAI'den AWS Bedrock'a) yönlendirerek zincirleme çökmeleri önler.

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Blank-EN.docxDOCX
all11.6 KB
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Example-EN.docxDOCX
all11.6 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Bos-TR.docxDOCX
all11.7 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Ornek-TR.docxDOCX
all11.7 KB
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Blank-EN.mdMD
all2.5 KB
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Example-EN.mdMD
all2.6 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Bos-TR.mdMD
all2.7 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Ornek-TR.mdMD
all2.8 KB
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Blank-EN.pdfPDF
all100.1 KB
TPL-AIR-022-LLM-Gateway-Routing-Fallback-and-Resilience-Design-Example-EN.pdfPDF
all102.5 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Bos-TR.pdfPDF
all102.6 KB
TPL-AIR-022-LLM-Ag-Gecidi-Yonlendirme-Yedekleme-ve-Dayaniklilik-Tasarimi-Ornek-TR.pdfPDF
all104.1 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir

Yetkili Standartlar ve Kaynaklar