Skip to main content

> tpl_air_043

Ajan Değerlendirme, Simülasyon ve Test Planı

Çok adımlı yörünge (trajectory) değerlendirmesini, araç çağırma (tool-calling) doğruluğunu, görev tamamlama oranlarını (Pass@k), sentetik kıyaslama simülasyonlarını, sahte (mock) araç ortamlarını ve LLM-as-a-judge puanlama kriterlerini kurallara bağlayan titiz ajan değerlendirme ve test planı.

TEMPLATE // INSPECT: TPL-AIR-043MODIFIED: 2026-09-19
KATEGORİÜretken Yapay Zekâ, RAG ve Ajanlar
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIPLN
FORMATLARDOCX, PDF, MD, MERMAID, SVG
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

Yörünge testlerini, araç çağırma hassasiyetini, görev tamamlamayı ve sahte test ortamlarını kurallara bağlayan ajan değerlendirme planı.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Mühendislik ekipleri otonom ajanları tek adımlı basit prompt testleriyle değerlendirir; bu da üretimde çok adımlı yörünge sapmalarını, sonsuz akıl yürütme döngülerini ve yıkıcı araç çağırma hatalarını öngörememelerine yol açar.

Ne Zaman Kullanılmalı?

  • Çok adımlı otonom ajanlar için sürekli entegrasyon (CI/CD) gerileme (regression) test paketleri kurarken
  • Sürümler arasında ajan görev tamamlama oranını (Pass@1, Pass@k) ve araç çağırma doğruluğunu ölçerken
  • Güvenli ve deterministik izole sahte (mock) ortamlarda karmaşık kullanıcı etkileşimlerini simüle ederken

Ne Zaman Kullanılmamalı?

  • Standart RAG sistemlerinde temel tek sorgulu getirme alaka düzeyi testleri için (TPL-AIR-030 kullanın)
  • Geleneksel yazılım API birim ve entegrasyon testleri için (TPL-QAV-007 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Değerlendirme Metrikleri ve Yörünge Puanlamastandard, enterprise

Temel nicel ajan metrikleri: Görev Tamamlama Oranı (Pass@1, Pass@3), Yörünge Verimliliği (optimal yola kıyasla araç adım sayısı), Araç Hassasiyeti/Duyarlılığı ve Anlamsal Doğruluk.

Yönerge:Yalnızca nihai yanıtı değil, ara akıl yürütme adımlarının ve araç seçimlerinin doğruluğunu da puanlayın.
2. 2. Altın Yörünge (Golden Trajectory) Veri Kümesi ve Senaryolarstandard, enterprise

Temsili kıyaslama test senaryoları: ideal akışlar, açıklama gerektiren belirsiz sorular, hasmane araç zehirleme girişimleri ve istisnai durum hataları.

Yönerge:Ajanın işlemi reddetmesi veya insan rehberliği istemesi gereken negatif test senaryolarını mutlaka ekleyin.
3. 3. Sahte Araç (Mock Tool) Koşumu ve Deterministik Simülasyonstandard, enterprise

Kurumsal API'leri (CRM, SQL DB, ERP) deterministik sentetik yanıtlarla taklit eden izole sahte sunucular. CI koşumlarında dış API dalgalanmalarını sıfırlama.

Yönerge:Otomatik ajan testlerini asla canlı veya paylaşılan test veritabanlarına karşı çalıştırmayın.
4. 4. Çok Boyutlu LLM-as-a-Judge Puanlama Kriterleristandard, enterprise

Katı 0-5 puanlama ölçekleriyle hakem modellerin devreye alınması: Kanıt Tabanlılık (Grounding), Araç Seçim Rasyonelliği, Güvenlik Politikası Uyumu ve Halüsinasyon Yokluğu.

Yönerge:Hakem modellerin güvenilirliğini insan uzman puanlarıyla korelasyonunu (inter-annotator agreement) hesaplayarak doğrulayın.
5. 5. CI/CD Otomatik Gerileme Kapıları ve Taban Çizgileristandard, enterprise

Promptfoo veya DeepEval araçlarının PR süreçlerine entegrasyonu. Kesin geçiş eşikleri: Pass@1 %90 altına düşemez, araç çağırma hata oranı <%2 olmalıdır.

Yönerge:Aşırı CI harcamasını önlemek için değerlendirme senaryosu başına maksimum belirteç ve süre sınırı koyun.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

Ajan Değerlendirme, Simülasyon ve Test Planı - Örnek Vaka Analizi

Örnek Organizasyon: Otonom Bulut Olay Teşhis Ajanı (Kubernetes ve CloudWatch Uyarılarını İnceleyen)

Otonom Bulut Olay Teşhis Ajanı (Kubernetes ve CloudWatch Uyarılarını İnceleyen) için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • 250 simüle edilmiş kesinti senaryosunu değerlendirerek %93,6 oranında Pass@1 otonom kök neden teşhisi başarısı elde etti
  • Yörünge verimliliği optimizasyonu ve prompt sadeleştirmesiyle gereksiz araç çağırma adımlarını %38 azalttı
  • Üretimde sonsuz döngü ve araç halüsinasyonu yaratabilecek 6 kusurlu PR'ın dağıtımını CI kapısında engelledi

Sıkça Sorulan Sorular

Ajan yörüngesini (trajectory) değerlendirmek nihai yanıtı değerlendirmek kadar neden kritiktir?

Bir ajan 15 verimsiz, maliyetli veya güvensiz araç çağrısı yaptıktan sonra şans eseri doğru yanıta ulaşmış olabilir (ör. gereksiz veritabanı sorguları çalıştırarak). Yörünge değerlendirmesi, ajanın güvenli sınırlar içinde kalarak en verimli yoldan ilerlediğini kanıtlar.

Deterministik olmayan ajan değerlendirmesinde Pass@k metriği nasıl çalışır?

Pass@k, ajanın k adet bağımsız simülasyon denemesinde görevi en az bir kez başarıyla tamamlayıp tamamlamadığını ölçer. Pass@1 ilk denemedeki operasyonel güvenilirliği ölçerken, Pass@3 veya Pass@5 ajanın yeniden deneme şansı verildiğinde kendini toparlama potansiyelini gösterir.

LLM-as-a-judge modellerinin belirli yanıt stillerine karşı yanlı (biased) davranması nasıl önlenir?

Hakem yanlılığı; ayrıntılı puanlama kriterleri, sayısal puan vermeden önce gerekçe açıklama zorunluluğu, referans kalibrasyon örnekleri ve insan uzman puanlarıyla düzenli korelasyon testleri yapılarak engellenir.

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Blank-EN.docxDOCX
all11.5 KB
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Example-EN.docxDOCX
all11.5 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Bos-TR.docxDOCX
all11.6 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Ornek-TR.docxDOCX
all11.7 KB
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Blank-EN.mdMD
all2.4 KB
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Example-EN.mdMD
all2.5 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Bos-TR.mdMD
all2.5 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Ornek-TR.mdMD
all2.6 KB
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Blank-EN.pdfPDF
all98.5 KB
TPL-AIR-043-Agent-Evaluation-Simulation-and-Test-Plan-Example-EN.pdfPDF
all101.6 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Bos-TR.pdfPDF
all100.2 KB
TPL-AIR-043-Ajan-Degerlendirme-Simulasyon-ve-Test-Plani-Ornek-TR.pdfPDF
all101.8 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir

Yetkili Standartlar ve Kaynaklar