Skip to main content

> hakem_olarak_llm_(llm-as-a-judge):_g-eval_çatısı,_pozisyon_yanlılığı_ve_referans_kalibrasyonu

Hakem Olarak LLM (LLM-as-a-Judge): G-Eval Çatısı, Pozisyon Yanlılığı ve Referans Kalibrasyonu

Otomatik LLM hakemleri (evaluators) A/B testlerinde neden kendi ürettiğini kayırma ve pozisyon yanlılığı (position bias) gösterir; G-Eval olasılıksal çerçevesi hakem güvenilirliğini nasıl kalibre eder?

Staff/Principal (L6+)

ÖZET VE TEKNİK CEVAP

Açık uçlu yapay zeka çıktılarını (özetleme kalitesi, sohbet kalitesi, mantık akışı) geleneksel metriklerle (BLEU, ROUGE) değerlendirmek imkansızdır çünkü bu metrikler eş anlamlı doğru kelimeleri bile cezalandırır. Sektör **Hakem Olarak LLM (LLM-as-a-Judge)** yöntemine geçmiştir: Güçlü bir modeli (GPT-4o, Claude 3.5) aday yanıtları puanlamak için hakem olarak kullanmak. Ancak acemi LLM hakemleri sistematik yanlılıklar taşır: (1) **Pozisyon Yanlılığı** (prompt'ta ilk sıraya konan cevabı %65 ihtimalle kayırma), (2) **Laf Kalabalığı Yanlılığı (Verbosity Bias)** (kısa ve öz doğru cevap yerine uzun ve süslü cevapları seçme) ve (3) **Kendi Ailesini Kayırma (Self-Enhancement Bias)**. **G-Eval Çerçevesi** bunu Çözüm Adımlı (Chain-of-Thought) değerlendirme kriterleri ve olasılıksal token ağırlıklı puanlama ($E[ ext{puan}] = sum p(s_i) imes s_i$) ile çözer; buna **Pozisyon Takası** ($[A,B]$ ve $[B,A]$ sıralarını ayrı ayrı test edip ortalama almak) ve referans kalibrasyonu eklenir.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

G-Eval yanlılık kalibrasyonu 4 adımdan oluşur: (1) Otomatik Değerlendirme Kriteri: Model önce göreve özel 5 adımlı açık bir değerlendirme kılavuzu (Doğruluk, Akıcılık, Öz Olma) üretir. (2) Adım Adım Akıl Yürütme (CoT): Hakem puan vermeden önce gerekçelerini ayrıntılı açıklar. (3) Olasılıksal Puan Ağırlıklandırması: G-Eval tek bir tam sayı seçmek yerine puan jetonlarının logit olasılıklarını çarparak ($ ext{Puan} = sum P(i) imes i$) pürüzsüz sürekli bir puan (ör. 4.38) üretir. (4) Pozisyon Takası: İkili karşılaştırmada 1. Aday önce A, sonra B pozisyonuna konarak iki kez test edilir. Hakem yer değiştirince fikrini değiştirirse sonuç 'Berabere' sayılır ve pozisyon yanlılığı sıfırlanır.

2. Doğru Kullanım Senaryosu

Prompt şablonlarının CI/CD otomatik regresyon testleri, fine-tuning model sürümlerinin değerlendirilmesi, RAG yanıt kalitesi kıyaslaması ve model seçim testleri.

3. Prodüksiyon Arıza Modları

Pozisyon takası yapmadan tek seferlik karşılaştırma hakemine güvenmek ve yeni modeldeki %30'luk 'iyileşmenin' aslında sadece pozisyon yanlılığı illüzyonu olması; GPT-4 modelini Claude ile kıyaslarken hakem olarak yine GPT-4'ü kullanıp kendi modelini kayırmasına izin vermek.

4. Teşhis ve Telemetri Sinyalleri

Hakem testlerinde A şıkkına konulan modelin sürekli %70+ kazanması; LLM hakem puanları ile insan uzman puanları arasındaki korelasyonun düşük kalması ($ ho < 0.60$); içi boş ama uzun metinlerin kısa doğru yanıtlardan daha yüksek puan alması.

5. Önleme ve Mimari Bariyerler

İki yönlü Pozisyon Takasını ($[A,B]$ ve $[B,A]$) zorunlu kılın; G-Eval token olasılık puanlaması kullanın; hakem modelin güvenilirliğini 100 adet insan etiketli altın veri setiyle test edip korelasyonu ($ ho ge 0.85$) doğrulayın.

6. Mimari Ödünleşimler (Trade-offs)

Pozisyon takaslı G-Eval testleri 2 kat daha fazla API çağrısı ve logit okuma yetkisi gerektirir; ancak insan uzmanlarla uyumlu, bilimsel kesinlikte ve güvenilir değerlendirme verisi sağlar.

Vaka İncelemesi (TinyCTO Örneği)

İki RAG prompt şablonunu test eden bir ekip, otomatik hakemin B Şablonunu %64 oranında kazanan ilan ettiğini gördü. Ancak iki yönlü Pozisyon Takası uygulandığında, B Şablonunun gerçek başarı oranı %49'a geriledi (tam beraberlik): B Şablonu sadece testlerin çoğunda ilk sıraya (A şıkkına) konulduğu için kazanmıştı. G-Eval kriterleri incelendiğinde A Şablonunun öz olma ve doğrulukta aslında daha üstün olduğu ortaya çıktı ve ekibin hatalı bir prompt'u canlıya alması engellendi.

İnteraktif Konsept Alıştırmaları

2 Alıştırma
Q1

Hakem Olarak LLM değerlendirmelerinde 'Pozisyon Yanlılığı' (Position Bias) nedir?

LLM hakemlerin gerçek kaliteye bakılmaksızın prompt'ta ilk sırada (A Şıkkı) sunulan cevabı kayırma eğilimidir.
Q2

G-Eval çerçevesi sürekli değerlendirme puanlarını nasıl hesaplar?

Tek bir tam sayı seçmek yerine puan jetonlarının olasılık dağılımının beklenen değerini hesaplayarak ($E[ ext{puan}] = sum P(i) imes i$).

Hakem Olarak LLM (LLM-as-a-Judge): G-Eval Çatısı, Pozisyon Yanlılığı ve Referans Kalibrasyonu — Sıkça Sorulan Sorular

Otomatik yapay zeka değerlendirmesinde 'Laf Kalabalığı Yanlılığı' (Verbosity Bias) nedir?

Kısa ve öz doğru yanıtlar yerine, uzun ve süslü metinlere otomatik olarak daha yüksek puan verme eğilimidir.

LLM hakemlerinin insan puanlarıyla uyumunu ölçmek için hangi korelasyon katsayısı kullanılır?

Spearman sıra korelasyon katsayısı ($ ho$) ve Kendall tau ($ au$). Kalibre edilmiş bir hakem model insanlarla $ ho ge 0.80$ korelasyon yakalamalıdır.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • LLM-as-a-Judge replaces rigid BLEU/ROUGE metrics for open-ended AI evaluation.
  • Naive judges suffer from severe Position Bias, Verbosity Bias, and Self-Enhancement Bias.
  • Always implement bilateral Position Swapping ($[A,B]$ and $[B,A]$) in pairwise benchmarks.
  • G-Eval calculates continuous score expectations via output token logit probabilities.

Yaygın Yanılgılar

  • Yanılgı: Asking an LLM judge to be objective eliminates bias (Gerçek: Systematic cognitive biases persist regardless of prompt wording).
  • Yanılgı: The same model used in production can impartially judge itself against competitors (Gerçek: Models show marked self-enhancement bias towards their own family).

Karar Kılavuzu & Önceliklendirme

Use DeepEval or custom G-Eval pipelines with Position Swapping for CI/CD prompt testing. Validate judge models against a human-annotated benchmark dataset before trusting scores.

Doğrulanmış Kaynaklar & Referanslar