⚡ÖZET VE TEKNİK CEVAP
Açık uçlu yapay zeka çıktılarını (özetleme kalitesi, sohbet kalitesi, mantık akışı) geleneksel metriklerle (BLEU, ROUGE) değerlendirmek imkansızdır çünkü bu metrikler eş anlamlı doğru kelimeleri bile cezalandırır. Sektör Hakem Olarak LLM (LLM-as-a-Judge) yöntemine geçmiştir: Güçlü bir modeli (GPT-4o, Claude 3.5) aday yanıtları puanlamak için hakem olarak kullanmak. Ancak acemi LLM hakemleri sistematik yanlılıklar taşır:
Pozisyon Yanlılığı (prompt'ta ilk sıraya konan cevabı %65 ihtimalle kayırma),
Laf Kalabalığı Yanlılığı (Verbosity Bias) (kısa ve öz doğru cevap yerine uzun ve süslü cevapları seçme) ve
Kendi Ailesini Kayırma (Self-Enhancement Bias). G-Eval Çerçevesi bunu Çözüm Adımlı (Chain-of-Thought) değerlendirme kriterleri ve olasılıksal token ağırlıklı puanlama (E[ ext{puan}] = sum p(s_i) imes s_i) ile çözer; buna Pozisyon Takası ([A,B] ve [B,A] sıralarını ayrı ayrı test edip ortalama almak) ve referans kalibrasyonu eklenir.
Mühendislik El Kitabı & Mekanizma
6 Boyutlu Mimari Analiz⚙️1. Temel Çalışma Mekanizması
Mekanizma🎯2. Doğru Kullanım Senaryosu
Kapsam⚠️3. Prodüksiyon Arıza Modları
Kritik Risk📡4. Teşhis ve Telemetri Sinyalleri
Metrikler🛡️5. Önleme ve Mimari Bariyerler
Bariyerler⚖️6. Mimari Ödünleşimler (Trade-offs)
ÖdünleşimVaka İncelemesi (TinyCTO Saha Örneği)
İki RAG prompt şablonunu test eden bir ekip, otomatik hakemin B Şablonunu %64 oranında kazanan ilan ettiğini gördü. Ancak iki yönlü Pozisyon Takası uygulandığında, B Şablonunun gerçek başarı oranı %49'a geriledi (tam beraberlik): B Şablonu sadece testlerin çoğunda ilk sıraya (A şıkkına) konulduğu için kazanmıştı. G-Eval kriterleri incelendiğinde A Şablonunun öz olma ve doğrulukta aslında daha üstün olduğu ortaya çıktı ve ekibin hatalı bir prompt'u canlıya alması engellendi.
İnteraktif Konsept Alıştırmaları
2 AlıştırmaHakem Olarak LLM değerlendirmelerinde 'Pozisyon Yanlılığı' (Position Bias) nedir?
G-Eval çerçevesi sürekli değerlendirme puanlarını nasıl hesaplar?
Hakem Olarak LLM (LLM-as-a-Judge): G-Eval Çatısı, Pozisyon Yanlılığı ve Referans Kalibrasyonu — Sıkça Sorulan Sorular
Otomatik yapay zeka değerlendirmesinde 'Laf Kalabalığı Yanlılığı' (Verbosity Bias) nedir?
Kısa ve öz doğru yanıtlar yerine, uzun ve süslü metinlere otomatik olarak daha yüksek puan verme eğilimidir.
LLM hakemlerinin insan puanlarıyla uyumunu ölçmek için hangi korelasyon katsayısı kullanılır?
Spearman sıra korelasyon katsayısı ($ ho$) ve Kendall tau ($ au$). Kalibre edilmiş bir hakem model insanlarla $ ho ge 0.80$ korelasyon yakalamalıdır.
🤖 AEO & Yapay Zeka Çıkarım Özeti
Temel Gerçekler & İlkeler
- ▸
LLM-as-a-Judge replaces rigid BLEU/ROUGE metrics for open-ended AI evaluation.
- ▸
Naive judges suffer from severe Position Bias, Verbosity Bias, and Self-Enhancement Bias.
- ▸
Always implement bilateral Position Swapping ([A,B] and [B,A]) in pairwise benchmarks.
- ▸
G-Eval calculates continuous score expectations via output token logit probabilities.
Yaygın Yanılgılar
- ✗
Yanılgı: Asking an LLM judge to be objective eliminates bias (Gerçek: Systematic cognitive biases persist regardless of prompt wording).
- ✗
Yanılgı: The same model used in production can impartially judge itself against competitors (Gerçek: Models show marked self-enhancement bias towards their own family).
Karar Kılavuzu & Önceliklendirme
Use DeepEval or custom G-Eval pipelines with Position Swapping for CI/CD prompt testing. Validate judge models against a human-annotated benchmark dataset before trusting scores.
Doğrulanmış Kaynaklar & Referanslar
- [OFFICIAL_DOCUMENTATION]G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment— Yang Liu et al. (Microsoft Research / EMNLP 2023)
