> tpl_air_020
Üretken Yapay Zekâ Değerlendirme ve Regresyon Paketi Şartnamesi
Küratörlüğü yapılmış altın test veri kümelerini, LLM-Yargıç (LLM-as-a-Judge) kalibre edilmiş rubriklerini, Ragas getirme metriklerini (bağlılık, yanıt ilgililiği, bağlam hatırlama), CI/CD dağıtım kapılarını ve istatistiksel regresyon iddialarını belirleyen otomatik üretken yapay zekâ değerlendirme ve regresyon test şartnamesi.
Altın veri kümelerini, LLM-Yargıç rubriklerini ve regresyon test kapılarını belirleyen CI/CD otomatik değerlendirme şartnamesi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Mühendisler canlı ortamda otomatik regresyon testleri olmadan istemleri değiştirir, sıcaklık ayarlarını günceller veya model sürümünü yükseltir; bu da yapılandırılmış JSON çıktılarını bozar, halüsinasyonlara yol açar ve kullanıcı deneyimini sessizce düşürür.
Ne Zaman Kullanılmalı?
- •LLM uygulamaları ve ajan istemleri için otomatik CI/CD kalite kapıları kurarken (GitHub Actions / GitLab CI)
- •Promptfoo, DeepEval veya Ragas çerçevelerini kullanarak LLM-Yargıç değerlendirme hatlarını yapılandırırken
- •Doğruluk, bağlam kesinliği, toksisite ve şema uyumu için istatistiksel regresyon eşikleri belirlerken
Ne Zaman Kullanılmamalı?
- •Klasik deterministik yazılım birim testleri ve mock testlerinde (standart Jest/Vitest çerçeveleri kullanın)
- •Üst düzey iş modeli fizibilite tuvalleri hazırlığında (TPL-AIM-015 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
4 katmanlı piramit: Birim iddiaları (JSON regex, kelime sayısı), Anlamsal benzerlik (BERTScore, gömmeler), LLM-Yargıç rubrikleri (G-Eval) ve İnsan uzman denetimleri.
Kapsamlı yargıç istemleri, az örnekli (few-shot) yönlendirmeler ve düşünce zinciri puanlama rubrikleri. Yargıç yanlılıklarının (konum, uzunluk, kendini kayırma) azaltılması.
Standart Ragas metrikleri: Bağlılık/Doğruluk (bağlama dayanaklılık), Yanıt İlgililiği, Bağlam Hatırlama ve Bağlam Kesinliği.
Promptfoo veya DeepEval testlerinin pull request iş akışlarına gömülmesi. İstem değişikliklerinde değerlendirmeleri çalıştırma ve skor farklarını raporlama.
Canlıya geçiş öncesinde yeni model sürümlerini (ör. gpt-4o sürüm yükseltmeleri) tam regresyon paketi genelinde onaylamak için resmi protokol.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
Üretken Yapay Zekâ Değerlendirme ve Regresyon Paketi Şartnamesi - Örnek Vaka Analizi
Örnek Organizasyon: Kurumsal Müşteri Destek Yapay Zekâ Yardımcısı Mühendislik Ekibi
Kurumsal Müşteri Destek Yapay Zekâ Yardımcısı Mühendislik Ekibi için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •Her Git commit'inde 340 altın müşteri sorgusunu değerlendiren Promptfoo CI/CD hattı kurularak 14 regresyon olayı engellendi
- •45 bin ürün dokümantasyon sayfasında %97,4 dayanak doğruluğunu koruyan Ragas değerlendirme altyapısı yapılandırıldı
- •Canlı dağıtım öncesinde istem güvenliğini doğrulamak için sentetik kullanıcı simülasyonu kullanan regresyon test ortamı oluşturuldu
Sıkça Sorulan Sorular
Klasik birim test çerçeveleri (Jest/PyTest) üretken yapay zekâ uygulamalarını neden yeterince değerlendiremez?
Klasik yazılım testleri deterministik eşitlik iddialarına (çıktı === beklenen) dayanır. LLM'ler ise deterministik olmayan, anlamsal olarak çeşitli doğal dil metinleri üretir. Üretken yapay zekâyı test etmek; anlamsal benzerlik, çok boyutlu rubriklere göre puanlama yapan LLM-Yargıç değerlendiricileri ve istatistiksel güven aralıkları gerektirir.
Bir LLM-Yargıç (LLM-as-a-Judge) değerlendiricisi öznellik yaratmadan nasıl çalışır?
Öznelliği en aza indirmek için yargıç modele her puan için (ör. 1'den 5'e) açık kriterler belirten katı bir Düşünce Zinciri (CoT) puanlama rubriği verilir. Yargıçtan olguları çıkarması, bağlamdan kanıt göstermesi, adım adım akıl yürütmesi ve hem sayısal puanı hem de gerekçeyi içeren yapılandırılmış JSON üretmesi istenir. 0.0 sıcaklık tekrarlanabilirliği garanti eder.
Ragas tarafından tanımlanan dört temel RAG değerlendirme metriği nedir?
Dört temel metrik şunlardır: (1) Bağlılık/Doğruluk (yanıtın halüsinasyon olmadan bağlama dayalı olup olmadığını ölçer), (2) Yanıt İlgililiği (yanıtın kullanıcı istemine odaklanıp odaklanmadığını ölçer), (3) Bağlam Kesinliği (getirilen parçalardaki sinyal-gürültü oranını ölçer) ve (4) Bağlam Hatırlama (gerekli tüm olguların getirilip getirilmediğini ölçer).
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Ragas: Automated Evaluation of Retrieval Augmented GenerationExploding Gradients • OFFICIAL REQUIREMENT
- Promptfoo: Test and evaluate LLM output quality and securityPromptfoo • OFFICIAL REQUIREMENT
- EU Artificial Intelligence Act: Article 15 Accuracy, Robustness and CybersecurityEuropean Parliament and Council • OFFICIAL REQUIREMENT
