Skip to main content

> büyük_dil_modellerinde_(llm)_i̇stem_önbellekleme_(prompt_caching)_ve_%90_maliyet_i̇ndirimi

Büyük Dil Modellerinde (LLM) İstem Önbellekleme (Prompt Caching) ve %90 Maliyet İndirimi

LLM istem önbellekleme (Prompt Caching - Anthropic Claude, OpenAI, DeepSeek), token çıkarım maliyetlerini nasıl %90'a varan oranda düşürür ve İlk Token Süresi (TTFT) gecikmesini %85 azaltır?

Senior (L5)

ÖZET VE TEKNİK CEVAP

Modern yapay zeka otonom ajanlarında ve geniş bağlamlı RAG uygulamalarında, girdi token'larının büyük çoğunluğu her kullanıcı mesajında tekrar tekrar gönderilen statik sistem talimatlarından, büyük PDF/kod bağlamlarından ve konuşma geçmişinden oluşur. İstem Önbellekleme (Prompt Caching), statik istem ön eklerine önbellek işaretçileri koymayı sağlar. Model sağlayıcı bu ön ekin Key-Value (KV) dikkat matrislerini GPU belleğinde saklar. Aynı ön eki kullanan sonraki API çağrıları matris hesaplamasını atlayarak girdi token maliyetini %90'a varan oranda düşürür (örneğin Anthropic Claude 3.5 Sonnet'te standart girdi $3,00/M iken önbelleklenmiş girdi yalnızca $0,375/M tutar) ve İlk Token Süresi (TTFT) gecikmesini %85 azaltır.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

Transformer model çıkarımı iki aşamadan oluşur: Prefill (girdi token'ları üzerinde O(N^2) matris hesaplama) ve Decode (çıktı token'larını tek tek üretme). Prompt caching, minimum token eşiğini (Anthropic için 1.024, OpenAI için 1.024 token) aşan ön eklerin KV-önbelleğini saklar. Fiyatlandırma: (1) Önbelleğe Yazma (Cache Write): İlk çağrıda %25 ek ücret. (2) Önbellekten Okuma (Cache Read): 5 dakikalık TTL süresince (her başarılı isabette otomatik sıfırlanır) sonraki tüm çağrılarda %90 indirim. İstemleri deterministik kurgulamak—statik sistem istemlerini, araç şemalarını ve dokümanları EN BAŞA, dinamik kullanıcı girdisini ise EN SONA koymak—önbellek isabetini maksimize eder.

2. Doğru Kullanım Senaryosu

Çok turlu konuşma ajanları, kod tabanı asistanları (Claude Code/Cursor bağlamları), 50k+ token'lık PDF ve sözleşme analizleri, yüzlerce araç şemasına sahip otonom sistemler ve müşteri destek botları.

3. Prodüksiyon Arıza Modları

Sistem isteminin en başına dinamik zaman damgası (`Tarih: 14:32:05.123`) veya rastgele UUID eklenmesi sonucu her API çağrısının önbellek ön ekini geçersiz kılması (cache miss) ve her seferinde %125 yazma cezası ödenmesi; araç (tool) tanımlarının sırasının her çağrıda rastgele değişmesi.

4. Teşhis ve Telemetri Sinyalleri

Yapay zeka sağlayıcı panellerinde `cache_read_input_tokens` metriğinin %0 görünmesi, `cache_creation_input_tokens` ve standart girdi maliyetlerinin tavan yapması; çok turlu konuşmalarda p95 TTFT gecikmesinin yüksek kalması.

5. Önleme ve Mimari Bariyerler

Deterministik istem hiyerarşisini zorunlu kılın: Sistem Talimatları -> Araç Şemaları -> Statik Bilgi Tabanı -> Konuşma Geçmişi -> Son Kullanıcı Mesajı; dinamik zaman damgalarını ve oturum değişkenlerini mesajın en sonuna yerleştirin; Anthropic için `cache_control: { type: 'ephemeral' }` işaretçilerini doğru noktalara koyun.

6. Mimari Ödünleşimler (Trade-offs)

Prompt caching %90 maliyet indirimi ve %85 daha hızlı ilk token yanıtı sağlar; ancak statik ön ekleri istekler arasında kesinlikle değişmez tutacak disiplinli bir istem mühendisliği mimarisi gerektirir.

Vaka İncelemesi (TinyCTO Örneği)

Bir hukuk teknolojisi ajanı, 100.000 token'lık bir sözleşme üzerinde Claude 3.5 Sonnet ile 50 turluk analiz yapıyordu. Prompt caching olmadan 50 turda 5 milyon token işleniyor ve görüşme başına $15,00 ($3,00/M) ödeniyordu. Sözleşme metnine Prompt Caching eklendiğinde 1. tur tek seferlik yazma ($0,375), 2-50. turlar ise önbellekten okuma ($1,47) yaparak maliyeti $15,00'dan $1,85'a (%87,7 indirim) düşürdü ve yanıt gecikmesini 6 saniyeden 0,9 saniyeye indirdi.

İnteraktif Konsept Alıştırmaları

2 Alıştırma
Q1

Büyük dil modellerinde (LLM) istem önbelleğinden (prompt cache) okuma yapılan token'lardaki indirim oranı nedir?

Standart girdi token fiyatına göre %90'a varan indirim (Claude 3.5 Sonnet'te $3,00/M yerine $0,30 - $0,375/M).
Q2

Hangi yaygın kodlama hatası LLM istem önbelleklemesini tamamen bozar ve devre dışı bırakır?

Sistem isteminin en başına dinamik değişkenler (zaman damgası, rastgele UUID) eklemek.

Büyük Dil Modellerinde (LLM) İstem Önbellekleme (Prompt Caching) ve %90 Maliyet İndirimi — Sıkça Sorulan Sorular

Bir LLM istem önbelleğinin (prompt cache) tipik yaşam süresi (TTL) nedir?

Genellikle 5 dakikadır; ancak her başarılı önbellek isabetinde TTL süresi otomatik olarak yeniden 5 dakikaya sıfırlanır.

İstem önbelleklemenin devreye girmesi için gereken minimum token boyutu nedir?

Anthropic Claude için 1.024 token (Opus için 2.048) ve OpenAI GPT-4o için 1.024 token.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • Prompt caching cuts input token costs by up to 90% and TTFT latency by up to 85%.
  • It stores precomputed transformer KV attention states in high-speed GPU memory.
  • Prompt structure must place static elements first and dynamic variables last.
  • Minimum threshold is 1,024 tokens; cache TTL refreshes on every hit.

Yaygın Yanılgılar

  • Yanılgı: Prompt caching caches output responses (Gerçek: It caches input prefix attention weights; the model still generates novel completions).
  • Yanılgı: Caching works even if prompt words are reordered (Gerçek: Cache matching is strict sequential prefix matching).

Karar Kılavuzu & Önceliklendirme

Structure all AI agent system prompts to place tools and knowledge bases at the top. Place dynamic user parameters and current timestamps at the very end of prompts.

Doğrulanmış Kaynaklar & Referanslar