> tpl_air_021
LLM Gözlemlenebilirlik, İzleme ve Kalite İzleme Planı
OpenTelemetry üretken yapay zekâ anlamsal standartlarını, dağıtık istem-çıktı açıklık (span) grafiklerini, belirteç tüketimi ve maliyet tahsis telemetrisini, gecikme izlemeyi (TTFT), gerçek zamanlı halüsinasyon kayma tespitini ve PagerDuty alarm politikalarını belirleyen canlı LLM uygulaması gözlemlenebilirlik ve çalışma zamanı izleme mimarisi.
OpenTelemetry izlemeyi, belirteç maliyet muhasebesini ve gecikme alarmlarını standartlaştıran canlı LLM gözlemlenebilirlik mimarisi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Karmaşık LLM uygulamaları kontrolsüz belirteç maliyetleri, saniyeler süren öngörülemeyen çıkarım gecikmeleri, bağlam penceresi kesilmeleri ve kalite kayıplarıyla canlıda sessizce arızalanır; SRE ekipleri ise ayrıntılı açıklık (span) düzeyinde görünürlükten yoksundur.
Ne Zaman Kullanılmalı?
- •Çok adımlı ajan iş akışları, RAG getirmeleri ve LLM tamamlamaları genelinde dağıtık izleme kurarken
- •Bulut model sağlayıcıları genelinde anlık belirteç harcamasını, kullanıcı başına maliyeti ve hız limiti doluluğunu izlerken
- •İlk Belirteç Süresi (TTFT), hata oranları, kullanıcı olumsuz oyları ve halüsinasyon kayması için canlı alarm eşikleri belirlerken
Ne Zaman Kullanılmamalı?
- •Yalın altyapıda temel sunucu CPU, bellek ve disk G/Ç izlemelerinde (Datadog veya Prometheus TPL-OPS-006 kullanın)
- •Toplu çevrimdışı model eğitimi deney takibinde (MLflow veya W&B TPL-AIM-019 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
OpenTelemetry GenAI öznitelikleri (gen_ai.system, gen_ai.request.model, gen_ai.usage.completion_tokens) kullanılarak istemci, ağ geçidi, vektör getirme ve model çıkarımı genelinde açıklık hiyerarşisi.
Ayrıntılı gecikme kırılımı: İlk Belirteç Süresi (TTFT, hedef <800ms), akan Belirteçler Arası Gecikme (ITL, hedef <40ms) ve model sağlayıcıları genelinde toplam istek süresi.
Girdi, çıktı ve önbelleğe alınan belirteçlerin gerçek zamanlı takibi. Maliyetlerin departmanlara paylaştırılması ve otomatik devre kesici bütçe sınırları.
Canlı izlerin %5'inin çevrimdışı LLM-Yargıç ile puanlanması, kullanıcı olumlu/olumsuz oylarının izlenmesi ve zaman içindeki kalite kayması.
PagerDuty çağrı eşikleri: 5 dakika boyunca >%1 hata oranı, 429 hız limiti aşımları, belirteç bütçe anomalileri ve P95 gecikme ihlalleri ile işletim rehberleri.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
LLM Gözlemlenebilirlik, İzleme ve Kalite İzleme Planı - Örnek Vaka Analizi
Örnek Organizasyon: Küresel Finansal İstihbarat Kurumsal Ajan Platformu
Küresel Finansal İstihbarat Kurumsal Ajan Platformu için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •18 dağıtık ajan servisinde Langfuse OpenTelemetry enstrümantasyonu kurularak günlük 1,2 milyon LLM çağrısı izlendi
- •İstem önbellekleme telemetrisiyle medyan akış İlk Belirteç Süresi (TTFT) %48 düşürülerek 1.450 ms'den 750 ms'ye indirildi
- •Canlıya alımdan sonraki 2 dakika içinde sonsuz ajan araç döngüsü tespit edilip engellendi ve yaklaşık 14.000 dolarlık harcama önlendi
Sıkça Sorulan Sorular
OpenTelemetry üretken yapay zekâ izleme açıklıklarını (spans) nasıl standartlaştırır?
OpenTelemetry, gen_ai ad alanı altında yapay zekâya özel anlamsal kurallar tanımlar. Temel öznitelikler şunlardır: gen_ai.system (ör. "openai", "anthropic"), gen_ai.request.model, gen_ai.response.model, gen_ai.usage.prompt_tokens, gen_ai.usage.completion_tokens ve gen_ai.request.temperature. Bu standartlaşma, farklı sağlayıcıların modellerinde tek tip gözlemlenebilirlik sağlar.
İlk Belirteç Süresi (TTFT) nedir ve kullanıcı deneyimi için neden kritiktir?
TTFT, kullanıcının bir istemi göndermesinden ilk akan belirtecin ekranda görünmesine kadar geçen süreyi ölçer. Etkileşimli kurumsal uygulamalarda hız algısı büyük ölçüde TTFT tarafından belirlenir. Toplam yanıt süresi 10 saniye sürse bile 800 ms altındaki bir TTFT kullanıcıya anında yanıt hissi verir.
Mühendislik ekipleri kontrolden çıkan ajan döngülerinde yıkıcı belirteç bütçesi patlamalarını nasıl önler?
Hem uygulama ağ geçidi katmanında hem de model sağlayıcı katmanında katı devre kesici bütçe sınırları belirleyerek. Ayrıca çoklu ajan döngülerine maksimum adım sayaçları (görev başına en fazla 10 adım sınırı) ve harcama hızı monitörleri (30 saniyede >50.000 belirteç tüketen görevleri iptal etme) kurmak sonsuz döngüleri ortadan kaldırır.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- OpenTelemetry Semantic Conventions for Generative AI SystemsOpenTelemetry • OFFICIAL REQUIREMENT
- Langfuse: Open Source LLM Engineering Platform (Tracing & Observability)Langfuse • OFFICIAL REQUIREMENT
- Arize Phoenix: AI Observability & Evaluation PlatformArize AI • OFFICIAL REQUIREMENT
