İstem Önbelleği (Prompt Cache)
Sistem Analizi
Normal Davranış
Gelen bir YZ (LLM) isteği ulaştığında, önbellek (cache) istem (prompt) belirteçlerini (tokens) analiz eder. Tam önek (prefix) eşleşmeleri için (örneğin, uzun sistem talimatları veya statik RAG bağlamı), istem değerlendirme (prompt evaluation) aşamasını atlayarak GPU'da veya ana bilgisayar belleğinde depolanan önceden hesaplanmış KV dikkat durumlarını (KV attention states) yeniden kullanır. Anlamsal (semantic) eşleşmeler için bir vektör deposuna (vector store) karşı kosinüs benzerliğini (cosine similarity) değerlendirir ve önceden doğrulanmış tamamlama yanıtlarını milisaniyeler içinde sunar.
Çöküş Davranışı
Anlamsal benzerlik eşikleri (semantic similarity thresholds) çok agresif bir şekilde ayarlandığında, önbellek ince nüanslı (nuanced) sorulara olgusal olarak yanlış cevaplar döndürür (örneğin, 'Hesabımı nasıl iptal ederim?' ile 'Hesabımı nasıl yükseltirim?' sorularını karıştırmak). Donanım seviyesindeki KV önbelleklerinde, bellek parçalanması (memory fragmentation) ve başarısız tensör tahliye politikaları (tensor eviction policies), bellek yetersizliği (OOM) GPU çekirdek paniklerini (kernel panics) tetikleyebilir.
İş Sonuçları
İstem önbelleğindeki (prompt cache) derin bir önbellek zehirlenmesi (cache poisoning) saldırısı veya kritik anahtar çakışması (key collision), bir kurumsal müşterinin son derece gizli finansal sorgularını doğrudan tamamen farklı, rakip bir kurumsal müşteriye sunar.
Görsel Tezahür
"YZ sohbet arayüzünün (LLM chat interface), kullanıcının hava durumu hakkındaki istemine (prompt) neşeyle bir rakibin eksiksiz, sansürsüz 3. çeyrek kazanç raporuyla (Q3 earnings report) yanıt vermesi."
Satirical Behavior
"A sophisticated system designed to save 4 cents on API calls by aggressively returning the wrong answer to the user as fast as possible."
Bilinen İsimler
Teknik Terminoloji
Hata Göstergeleri
Sistem Mimarisi
FAQ
Normalde nasıl davranır?
Gelen bir YZ (LLM) isteği ulaştığında, önbellek (cache) istem (prompt) belirteçlerini (tokens) analiz eder. Tam önek (prefix) eşleşmeleri için (örneğin, uzun sistem talimatları veya statik RAG bağlamı), istem değerlendirme (prompt evaluation) aşamasını atlayarak GPU'da veya ana bilgisayar belleğinde depolanan önceden hesaplanmış KV dikkat durumlarını (KV attention states) yeniden kullanır. Anlamsal (semantic) eşleşmeler için bir vektör deposuna (vector store) karşı kosinüs benzerliğini (cosine similarity) değerlendirir ve önceden doğrulanmış tamamlama yanıtlarını milisaniyeler içinde sunar.
Nasıl çöker?
Anlamsal benzerlik eşikleri (semantic similarity thresholds) çok agresif bir şekilde ayarlandığında, önbellek ince nüanslı (nuanced) sorulara olgusal olarak yanlış cevaplar döndürür (örneğin, 'Hesabımı nasıl iptal ederim?' ile 'Hesabımı nasıl yükseltirim?' sorularını karıştırmak). Donanım seviyesindeki KV önbelleklerinde, bellek parçalanması (memory fragmentation) ve başarısız tensör tahliye politikaları (tensor eviction policies), bellek yetersizliği (OOM) GPU çekirdek paniklerini (kernel panics) tetikleyebilir.
İş sonuçları nelerdir?
İstem önbelleğindeki (prompt cache) derin bir önbellek zehirlenmesi (cache poisoning) saldırısı veya kritik anahtar çakışması (key collision), bir kurumsal müşterinin son derece gizli finansal sorgularını doğrudan tamamen farklı, rakip bir kurumsal müşteriye sunar.
What is the fundamental difference between hardware KV-cache sharing and application-level semantic prompt caching?
Hardware KV-cache sharing operates directly on GPU VRAM at the model inference engine level (e.g., vLLM or TensorRT-LLM), caching the exact mathematical Key-Value attention tensors of prompt prefixes to eliminate the prefill compute phase while preserving deterministic generation. Application-level semantic caching stores complete textual completions in an external vector database (like Redis or Qdrant) based on embedding similarity, bypassing model inference entirely.
How do prompt caches prevent cross-tenant data leakage in multi-tenant SaaS environments?
Prompt caches must partition cache keys using strict cryptographic composites containing the tenant ID, user permissions, and session scope alongside the prompt hash. If prompts contain user-specific context or dynamic variables, the cache must isolate the static shared system prefix into a globally cached KV-block while keeping the dynamic user suffix strictly ephemeral.
Sistemi keşfet
AI özeti
Prompt Cache is a AI_AND_AGENT_SYSTEMS system in TinyCTO.tv. When an incoming LLM request arrives, the cache analyzes the prompt tokens. For exact prefix matches (e.g., long system instructions or static RAG context), it reuses pre-computed KV attention states stored in GPU or host memory, bypassing the prompt evaluation phase. For semantic matches, it evaluates cosine similarity against a vector store and serves previously validated completion responses within milliseconds.
