ÖZET VE TEKNİK CEVAP
Modern yapay zeka otonom ajanlarında ve geniş bağlamlı RAG uygulamalarında, girdi token'larının büyük çoğunluğu her kullanıcı mesajında tekrar tekrar gönderilen statik sistem talimatlarından, büyük PDF/kod bağlamlarından ve konuşma geçmişinden oluşur. İstem Önbellekleme (Prompt Caching), statik istem ön eklerine önbellek işaretçileri koymayı sağlar. Model sağlayıcı bu ön ekin Key-Value (KV) dikkat matrislerini GPU belleğinde saklar. Aynı ön eki kullanan sonraki API çağrıları matris hesaplamasını atlayarak girdi token maliyetini %90'a varan oranda düşürür (örneğin Anthropic Claude 3.5 Sonnet'te standart girdi $3,00/M iken önbelleklenmiş girdi yalnızca $0,375/M tutar) ve İlk Token Süresi (TTFT) gecikmesini %85 azaltır.
Mühendislik El Kitabı & Mekanizma
1. Temel Çalışma Mekanizması
Transformer model çıkarımı iki aşamadan oluşur: Prefill (girdi token'ları üzerinde O(N^2) matris hesaplama) ve Decode (çıktı token'larını tek tek üretme). Prompt caching, minimum token eşiğini (Anthropic için 1.024, OpenAI için 1.024 token) aşan ön eklerin KV-önbelleğini saklar. Fiyatlandırma: (1) Önbelleğe Yazma (Cache Write): İlk çağrıda %25 ek ücret. (2) Önbellekten Okuma (Cache Read): 5 dakikalık TTL süresince (her başarılı isabette otomatik sıfırlanır) sonraki tüm çağrılarda %90 indirim. İstemleri deterministik kurgulamak—statik sistem istemlerini, araç şemalarını ve dokümanları EN BAŞA, dinamik kullanıcı girdisini ise EN SONA koymak—önbellek isabetini maksimize eder.
2. Doğru Kullanım Senaryosu
Çok turlu konuşma ajanları, kod tabanı asistanları (Claude Code/Cursor bağlamları), 50k+ token'lık PDF ve sözleşme analizleri, yüzlerce araç şemasına sahip otonom sistemler ve müşteri destek botları.
3. Prodüksiyon Arıza Modları
Sistem isteminin en başına dinamik zaman damgası (`Tarih: 14:32:05.123`) veya rastgele UUID eklenmesi sonucu her API çağrısının önbellek ön ekini geçersiz kılması (cache miss) ve her seferinde %125 yazma cezası ödenmesi; araç (tool) tanımlarının sırasının her çağrıda rastgele değişmesi.
4. Teşhis ve Telemetri Sinyalleri
Yapay zeka sağlayıcı panellerinde `cache_read_input_tokens` metriğinin %0 görünmesi, `cache_creation_input_tokens` ve standart girdi maliyetlerinin tavan yapması; çok turlu konuşmalarda p95 TTFT gecikmesinin yüksek kalması.
5. Önleme ve Mimari Bariyerler
Deterministik istem hiyerarşisini zorunlu kılın: Sistem Talimatları -> Araç Şemaları -> Statik Bilgi Tabanı -> Konuşma Geçmişi -> Son Kullanıcı Mesajı; dinamik zaman damgalarını ve oturum değişkenlerini mesajın en sonuna yerleştirin; Anthropic için `cache_control: { type: 'ephemeral' }` işaretçilerini doğru noktalara koyun.
6. Mimari Ödünleşimler (Trade-offs)
Prompt caching %90 maliyet indirimi ve %85 daha hızlı ilk token yanıtı sağlar; ancak statik ön ekleri istekler arasında kesinlikle değişmez tutacak disiplinli bir istem mühendisliği mimarisi gerektirir.
Vaka İncelemesi (TinyCTO Örneği)
Bir hukuk teknolojisi ajanı, 100.000 token'lık bir sözleşme üzerinde Claude 3.5 Sonnet ile 50 turluk analiz yapıyordu. Prompt caching olmadan 50 turda 5 milyon token işleniyor ve görüşme başına $15,00 ($3,00/M) ödeniyordu. Sözleşme metnine Prompt Caching eklendiğinde 1. tur tek seferlik yazma ($0,375), 2-50. turlar ise önbellekten okuma ($1,47) yaparak maliyeti $15,00'dan $1,85'a (%87,7 indirim) düşürdü ve yanıt gecikmesini 6 saniyeden 0,9 saniyeye indirdi.
İnteraktif Konsept Alıştırmaları
2 AlıştırmaBüyük dil modellerinde (LLM) istem önbelleğinden (prompt cache) okuma yapılan token'lardaki indirim oranı nedir?
Hangi yaygın kodlama hatası LLM istem önbelleklemesini tamamen bozar ve devre dışı bırakır?
Büyük Dil Modellerinde (LLM) İstem Önbellekleme (Prompt Caching) ve %90 Maliyet İndirimi — Sıkça Sorulan Sorular
Bir LLM istem önbelleğinin (prompt cache) tipik yaşam süresi (TTL) nedir?
Genellikle 5 dakikadır; ancak her başarılı önbellek isabetinde TTL süresi otomatik olarak yeniden 5 dakikaya sıfırlanır.
İstem önbelleklemenin devreye girmesi için gereken minimum token boyutu nedir?
Anthropic Claude için 1.024 token (Opus için 2.048) ve OpenAI GPT-4o için 1.024 token.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸Prompt caching cuts input token costs by up to 90% and TTFT latency by up to 85%.
- ▸It stores precomputed transformer KV attention states in high-speed GPU memory.
- ▸Prompt structure must place static elements first and dynamic variables last.
- ▸Minimum threshold is 1,024 tokens; cache TTL refreshes on every hit.
Yaygın Yanılgılar
- ✗Yanılgı: Prompt caching caches output responses (Gerçek: It caches input prefix attention weights; the model still generates novel completions).
- ✗Yanılgı: Caching works even if prompt words are reordered (Gerçek: Cache matching is strict sequential prefix matching).
Karar Kılavuzu & Önceliklendirme
Structure all AI agent system prompts to place tools and knowledge bases at the top. Place dynamic user parameters and current timestamps at the very end of prompts.
Doğrulanmış Kaynaklar & Referanslar
- [OFFICIAL_DOCUMENTATION]Anthropic Claude Prompt Caching Architecture and Pricing— Anthropic Documentation
