ÖZET VE TEKNİK CEVAP
Tipik yapay zeka ürünlerinde kullanıcı sorularının karmaşıklığı güç yasasını (power-law) izler: Soruların %70'i basit ve dar kapsamlıdır (sınıflandırma, veri formatlama, selamlama, kısa özet) ve 1 milyon jetonu 0,15 dolar olan ultra ucuz hafif modellerle (GPT-4o-mini, Claude 3.5 Haiku, LLaMA-3-8B) kusursuz şekilde çözülebilir. Sadece %30'luk kısım derin mantık, mimari analiz ve matematik gerektiren pahalı amiral gemisi modelleri ($3-$15 / 1M jeton) zorunlu kılar. Tüm trafiği en pahalı modele göndermek büyük bir bütçe israfıdır. **Maliyet Odaklı Model Kademeleri (Model Cascades / FrugalGPT)** akıllı iki katmanlı bir yönlendirici kurar: (1) Hızlı bir niyet sınıflandırıcı 2 ms'de sorunun zorluğunu ölçer, (2) Basit sorular ucuz modele gönderilir, (3) Çıktıdaki güven puanı veya doğrulama filtresi yetersiz kalırsa soru otomatik olarak bir üst kademedeki amiral gemisi modele devredilir (cascade fallback).
Mühendislik El Kitabı & Mekanizma
1. Temel Çalışma Mekanizması
Maliyet odaklı model basamaklandırma 3 yönlendirme mimarisiyle çalışır: (1) Ön Tahminli Yönlendirme: Hafif bir BERT veya vektör sınıflandırıcı sorunun zorluğunu $C(Q) in [0, 1]$ puanlar. Puan < 0.4 ise istek doğrudan 1. Kademe Ucuz Modele gider ($0.15/1M). Yüksekse doğrudan Amiral Modele ($3.00/1M) aktarılır. (2) Üretim Sonrası Doğrulama ile Kademe Atlama: Önce ucuz model yanıt üretir; yanıtın semantik entropisi veya kural doğrulayıcısı güven puanına bakar. Güven yetersizse yanıt çöpe atılır ve soru amiral modele iletilir. (3) Çoklu Sağlayıcı Yedeklemesi: OpenAI yanıt süresi 2,5 saniyeyi aşarsa veya 5xx hatası verirse, vekil sunucu anında Anthropic veya AWS Bedrock'a geçer.
2. Doğru Kullanım Senaryosu
Yüksek trafikli son kullanıcı yapay zeka uygulamaları, müşteri destek botları, belge işleme boru hatları, kurumsal arama motorları ve kodlama asistanları.
3. Prodüksiyon Arıza Modları
Aşırı Basamaklandırma (Over-cascading): Doğrulama eşiğini çok katı tutup soruların %90'ını HEM küçük modele HEM büyük modele çalıştırmak; bu durumun gecikmeyi katlaması ve maliyeti DÜŞÜRMEK YERİNE ARTIRMASI; tıbbi veya hukuki kritik soruları ucuz modellere yönlendirip hatalı kararlar almak.
4. Teşhis ve Telemetri Sinyalleri
Aylık LLM faturalarının kullanıcı artışından çok daha hızlı büyümesi; yönlendirici panosunda tüm trafiğin en pahalı modele aktığının görülmesi; kademe atlama oranının %40'ı geçmesi (hatalı kalibre edilmiş yönlendirici göstergesi).
5. Önleme ve Mimari Bariyerler
Yönlendirme sınıflandırıcısını insan etiketli test veri setleriyle kalibre edin; 1. Kademe ucuz modelin toplam trafiğin en az %60-70'ini kademe atlamadan başarıyla çözmesini hedefleyin; kritik iş alanları için kesin kurallar koyun (`fatura_itirazi` gibi hassas konular doğrudan amiral modele gitsin).
6. Mimari Ödünleşimler (Trade-offs)
Model kademelendirme ~5 ms'lik bir yönlendirme süresi ve basamak atlanan nadir sorularda iki modelin çalışma gecikmesini getirir; ancak toplam yapay zeka operasyon maliyetlerini %60-80 azaltırken çıktı kalitesini zirvede tutar.
Vaka İncelemesi (TinyCTO Örneği)
Ayda 2 milyon sohbet sorgusu işleyen bir SaaS şirketi, tüm istekleri GPT-4o'ya gönderdiği için ayda $48.000 ödüyordu. Ekip RouteLLM tabanlı model kademelendirmesi kurdu: Hafif bir sınıflandırıcı basit sohbetleri (trafiğin %68'i) GPT-4o-mini'ye ($0.15/1M), karmaşık kodlama ve mantık sorularını (trafiğin %32'si) ise GPT-4o'ya yönlendirdi. Kullanıcı memnuniyet puanı 4.8/5.0 seviyesinde sabit kalırken, aylık API faturası $48.000'dan $11.200'a düştü (%76 tasarruf sağlandı).
İnteraktif Konsept Alıştırmaları
2 AlıştırmaÜretken yapay zeka sistem tasarımında 'Model Kademesi' (Model Cascade) nedir?
Yönlendirme mimarilerinde 'Aşırı Basamaklandırma' (Over-Cascading) riskinin sonucu nedir?
Model Kademeleri (Model Cascades): Maliyet Odaklı Yönlendirme ve Akıllı Model Basamaklandırma — Sıkça Sorulan Sorular
Hangi açık kaynaklı kütüphaneler otomatik model yönlendirmesi sağlar?
RouteLLM (LMSYS / UC Berkeley), FrugalGPT, LiteLLM Router ve Martian Model Router.
RouteLLM bir sorunun kolay mı yoksa zor mu olduğuna nasıl karar verir?
LMSYS Chatbot Arena'daki binlerce insan karşılaştırma verisi üzerinde eğitilen hafif tercih sınıflandırıcıları (BERT veya Vektör benzerliği) aracılığıyla.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸Sending 100% of traffic to frontier models causes massive, unnecessary financial waste.
- ▸70% of typical user queries are solved perfectly by ultra-cheap Tier-1 models ($0.15/1M).
- ▸Model cascades evaluate query complexity upfront and verify response confidence before fallback.
- ▸Cuts overall LLM operating expenditures by 60-80% with zero perceptible quality degradation.
Yaygın Yanılgılar
- ✗Yanılgı: Small models produce terrible results for all tasks (Gerçek: Modern lightweight models match frontier performance on 70% of structured/simple tasks).
- ✗Yanılgı: Cascading always adds noticeable latency (Gerçek: Classification takes <5ms; simple queries return 2x faster from small models).
Karar Kılavuzu & Önceliklendirme
Implement RouteLLM or LiteLLM Router to split traffic between GPT-4o-mini and GPT-4o. Set strict confidence thresholds to keep cascade fallback rates between 10% and 25%.
Doğrulanmış Kaynaklar & Referanslar
- [OFFICIAL_DOCUMENTATION]FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Accuracy— Lingjiao Chen, Matei Zaharia, James Zou (Stanford University / arXiv)
