> tpl_air_051
Ajan Değerlendirme Veri Kümesi ve Senaryo Kataloğu
Görev karmaşıklığı seviyelerini, uç durum enjeksiyonlarını, kullanıcı persona varyantlarını, çok adımlı akıl yürütme tuzaklarını ve doğrulanmış referans yörüngeleri kurallara bağlayan yönetilen kıyaslama veri kümesi ve test senaryosu kataloğu.
Görev karmaşıklığını, uç durumları, kullanıcı personalarını ve referans yörüngeleri kurallara bağlayan test senaryo kataloğu.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Yapay zeka mühendisleri otonom ajanları uç durumları, hasmane girdileri ve çok adımlı mantık tuzaklarını içermeyen gayriresmi testlerle sınar; bu da her prompt güncellemesinde sessiz performans kayıplarına yol açar.
Ne Zaman Kullanılmalı?
- •Çoklu ajan sistemleri için referans altın değerlendirme veri kümelerini toplarken, yapılandırırken ve sürümlerken
- •Başlangıç seviyesindeki kullanıcıları, belirsiz soruları ve hasmane prompt enjeksiyonlarını kapsayan senaryolar üretirken
- •Otomatik CI/CD ajan gerileme testleri için referans yürütme yörüngeleri (ground-truth trajectories) oluştururken
Ne Zaman Kullanılmamalı?
- •Geniş kurumsal veri kataloğu ve metadata keşfi için (TPL-AIM-004 kullanın)
- •Canlı ortam yürütme yörüngesi izleme ve telemetri için (TPL-AIR-044 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
Senaryoların zorluk seviyelerine ayrılması: 1. Seviye (Tek araçlı basit arama), 2. Seviye (Çok araçlı sıralı sentez), 3. Seviye (Açıklama gerektiren belirsiz niyet), 4. Seviye (Hasmane uç durum saldırısı).
Test senaryolarının anonimleştirilmiş müşteri kayıtlarından, canlı arıza incelemelerinden (TPL-AIR-048) ve alan uzmanı mülakatlarından derlenmesi.
Her senaryo için doğrulanmış en uygun akıl yürütme yolu: prompt girdisi, beklenen araç çağrıları, kesin parametreler ve kabul edilebilir yanıt kriterleri.
Farklı kullanıcı tarzlarının dahil edilmesi: teknik kısaltmalar, ana dili olmayan bozuk cümleler, duygusal/öfkeli ifadeler ve parça parça gönderilen mesajlar.
Veri kümelerinin DVC veya Hugging Face Git LFS ile sürümlenmesi. Değerlendirme testlerinin model eğitim veya ince ayar (fine-tuning) verilerine karışmasının engellenmesi.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
Ajan Değerlendirme Veri Kümesi ve Senaryo Kataloğu - Örnek Vaka Analizi
Örnek Organizasyon: Kurumsal E-Ticaret Operasyonları Çoklu Ajan Kıyaslama Kütüphanesi (500 Altın Yörünge Senaryosu)
Kurumsal E-Ticaret Operasyonları Çoklu Ajan Kıyaslama Kütüphanesi (500 Altın Yörünge Senaryosu) için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •12 farklı müşteri personasını ve 4 zorluk seviyesini kapsayan 500 referans altın senaryo derledi
- •Model parametre güncellemesi öncesinde çoklu sipariş iptal akışlarındaki %16'lık doğruluk kaybını erkenden yakaladı
- •DVC kriptografik özetleriyle test verilerini karantinaya alarak eğitim verisi bulaşma riskini sıfırladı
Sıkça Sorulan Sorular
Referans değerlendirme veri kümeleri neden belirsiz ve negatif senaryoları da içermelidir?
Veri kümesi yalnızca net ve çözülebilir görevlerden oluşursa, ajan gerçek dünyadaki belirsiz talepler karşısında da tahmin yürütmeye veya kontrolsüz araç çalıştırmaya çalışır. Belirsiz senaryolar ajanın durup açıklama isteme veya reddetme yeteneğini test eder.
Veri bulaşması (data contamination) ajan kıyaslama testlerinin geçerliliğini nasıl tehdit eder?
Test senaryoları temel modellerin eğitim verilerine veya ince ayar setlerine sızarsa, ajan doğru adımları ezberler. Bu durum testlerde yüksek başarı yanılsaması yaratırken ajanın canlı ortamda çökmesine yol açar.
Ajan kıyaslama mühendisliğinde Veri Sürüm Kontrolünün (DVC) rolü nedir?
DVC, büyük değerlendirme veri kümelerini git kodlarıyla senkronize olarak kriptografik özetlerle (hash) takip eder. Bir performans düşüşü yaşandığında, mühendisler aylar önceki tam test verisini yeniden çağırarak modelin gerileyip gerilemediğini kesin olarak kanıtlayabilir.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Datasheets for Datasets (Communications of the ACM, Gebru et al.)ACM • OFFICIAL REQUIREMENT
- Data Version Control (DVC) DocumentationIterative.ai • OFFICIAL REQUIREMENT
- NIST AI 100-1: Artificial Intelligence Risk Management FrameworkNIST • OFFICIAL REQUIREMENT
