Skip to main content

> tpl_air_020

Üretken Yapay Zekâ Değerlendirme ve Regresyon Paketi Şartnamesi

Küratörlüğü yapılmış altın test veri kümelerini, LLM-Yargıç (LLM-as-a-Judge) kalibre edilmiş rubriklerini, Ragas getirme metriklerini (bağlılık, yanıt ilgililiği, bağlam hatırlama), CI/CD dağıtım kapılarını ve istatistiksel regresyon iddialarını belirleyen otomatik üretken yapay zekâ değerlendirme ve regresyon test şartnamesi.

TEMPLATE // INSPECT: TPL-AIR-020MODIFIED: 2026-09-19
KATEGORİÜretken Yapay Zekâ, RAG ve Ajanlar
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIDOC
FORMATLARDOCX, PDF, MD, MERMAID, SVG
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

Altın veri kümelerini, LLM-Yargıç rubriklerini ve regresyon test kapılarını belirleyen CI/CD otomatik değerlendirme şartnamesi.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Mühendisler canlı ortamda otomatik regresyon testleri olmadan istemleri değiştirir, sıcaklık ayarlarını günceller veya model sürümünü yükseltir; bu da yapılandırılmış JSON çıktılarını bozar, halüsinasyonlara yol açar ve kullanıcı deneyimini sessizce düşürür.

Ne Zaman Kullanılmalı?

  • LLM uygulamaları ve ajan istemleri için otomatik CI/CD kalite kapıları kurarken (GitHub Actions / GitLab CI)
  • Promptfoo, DeepEval veya Ragas çerçevelerini kullanarak LLM-Yargıç değerlendirme hatlarını yapılandırırken
  • Doğruluk, bağlam kesinliği, toksisite ve şema uyumu için istatistiksel regresyon eşikleri belirlerken

Ne Zaman Kullanılmamalı?

  • Klasik deterministik yazılım birim testleri ve mock testlerinde (standart Jest/Vitest çerçeveleri kullanın)
  • Üst düzey iş modeli fizibilite tuvalleri hazırlığında (TPL-AIM-015 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Değerlendirme Mimarisi: Metrikler, Rubrikler ve Altın Veri Kümeleristandard, enterprise

4 katmanlı piramit: Birim iddiaları (JSON regex, kelime sayısı), Anlamsal benzerlik (BERTScore, gömmeler), LLM-Yargıç rubrikleri (G-Eval) ve İnsan uzman denetimleri.

Yönerge:Tipik kullanıcı yolculuklarını ve çekişmeli sınır durumları kapsayan en az 200 doğrulanmış altın test çifti bulundurun.
2. 2. LLM-Yargıç Kalibrasyonu, Tutarlılık ve Yanlılık Kontrolüstandard, enterprise

Kapsamlı yargıç istemleri, az örnekli (few-shot) yönlendirmeler ve düşünce zinciri puanlama rubrikleri. Yargıç yanlılıklarının (konum, uzunluk, kendini kayırma) azaltılması.

Yönerge:Yargıç olarak sıcaklığı kesinlikle 0.0 olarak ayarlanmış gelişmiş bir model (GPT-4o veya Claude 3.5 Sonnet) kullanın.
3. 3. RAG Getirme Metrikleri: Doğruluk, İlgililik ve Kesinlikstandard, enterprise

Standart Ragas metrikleri: Bağlılık/Doğruluk (bağlama dayanaklılık), Yanıt İlgililiği, Bağlam Hatırlama ve Bağlam Kesinliği.

Yönerge:Bağlılık skorunun >= 0,95 ve Yanıt İlgililiğinin >= 0,90 olmasını zorunlu kılan katı bir CI/CD kapısı uygulayın.
4. 4. Otomatik CI/CD Regresyon Test Entegrasyonustandard, enterprise

Promptfoo veya DeepEval testlerinin pull request iş akışlarına gömülmesi. İstem değişikliklerinde değerlendirmeleri çalıştırma ve skor farklarını raporlama.

Yönerge:Herhangi bir PR istatistiksel olarak anlamlı bir regresyona (>%2 P95 düşüşü) yol açarsa derlemeyi otomatik olarak başarısız sayın.
5. 5. Model Sürüm Yükseltme ve Hiperparametre Regresyon Kapılarıstandard, enterprise

Canlıya geçiş öncesinde yeni model sürümlerini (ör. gpt-4o sürüm yükseltmeleri) tam regresyon paketi genelinde onaylamak için resmi protokol.

Yönerge:Tüm altın regresyon paketini çalıştırmadan ve skor farklarını kaydetmeden canlıda model işaretçisini asla değiştirmeyin.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

Üretken Yapay Zekâ Değerlendirme ve Regresyon Paketi Şartnamesi - Örnek Vaka Analizi

Örnek Organizasyon: Kurumsal Müşteri Destek Yapay Zekâ Yardımcısı Mühendislik Ekibi

Kurumsal Müşteri Destek Yapay Zekâ Yardımcısı Mühendislik Ekibi için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • Her Git commit'inde 340 altın müşteri sorgusunu değerlendiren Promptfoo CI/CD hattı kurularak 14 regresyon olayı engellendi
  • 45 bin ürün dokümantasyon sayfasında %97,4 dayanak doğruluğunu koruyan Ragas değerlendirme altyapısı yapılandırıldı
  • Canlı dağıtım öncesinde istem güvenliğini doğrulamak için sentetik kullanıcı simülasyonu kullanan regresyon test ortamı oluşturuldu

Sıkça Sorulan Sorular

Klasik birim test çerçeveleri (Jest/PyTest) üretken yapay zekâ uygulamalarını neden yeterince değerlendiremez?

Klasik yazılım testleri deterministik eşitlik iddialarına (çıktı === beklenen) dayanır. LLM'ler ise deterministik olmayan, anlamsal olarak çeşitli doğal dil metinleri üretir. Üretken yapay zekâyı test etmek; anlamsal benzerlik, çok boyutlu rubriklere göre puanlama yapan LLM-Yargıç değerlendiricileri ve istatistiksel güven aralıkları gerektirir.

Bir LLM-Yargıç (LLM-as-a-Judge) değerlendiricisi öznellik yaratmadan nasıl çalışır?

Öznelliği en aza indirmek için yargıç modele her puan için (ör. 1'den 5'e) açık kriterler belirten katı bir Düşünce Zinciri (CoT) puanlama rubriği verilir. Yargıçtan olguları çıkarması, bağlamdan kanıt göstermesi, adım adım akıl yürütmesi ve hem sayısal puanı hem de gerekçeyi içeren yapılandırılmış JSON üretmesi istenir. 0.0 sıcaklık tekrarlanabilirliği garanti eder.

Ragas tarafından tanımlanan dört temel RAG değerlendirme metriği nedir?

Dört temel metrik şunlardır: (1) Bağlılık/Doğruluk (yanıtın halüsinasyon olmadan bağlama dayalı olup olmadığını ölçer), (2) Yanıt İlgililiği (yanıtın kullanıcı istemine odaklanıp odaklanmadığını ölçer), (3) Bağlam Kesinliği (getirilen parçalardaki sinyal-gürültü oranını ölçer) ve (4) Bağlam Hatırlama (gerekli tüm olguların getirilip getirilmediğini ölçer).

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Blank-EN.docxDOCX
all11.5 KB
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Example-EN.docxDOCX
all11.5 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Bos-TR.docxDOCX
all11.6 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Ornek-TR.docxDOCX
all11.7 KB
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Blank-EN.mdMD
all2.5 KB
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Example-EN.mdMD
all2.6 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Bos-TR.mdMD
all2.6 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Ornek-TR.mdMD
all2.7 KB
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Blank-EN.pdfPDF
all100.4 KB
TPL-AIR-020-GenAI-Evaluation-and-Regression-Suite-Specification-Example-EN.pdfPDF
all101.7 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Bos-TR.pdfPDF
all101.6 KB
TPL-AIR-020-Uretken-Yapay-Zeka-Degerlendirme-ve-Regresyon-Paketi-Sartnamesi-Ornek-TR.pdfPDF
all102.0 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir

Yetkili Standartlar ve Kaynaklar