Skip to main content

> ML_LITERATURE // ZHENG-2023-JUDGING-LLM-AS-A-JUDGE-MT-BENCH-CHATBOT-ARENA_v1.0

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Hao Zhang, Siyuan Zhuang, Yonghao Zhuang, Lingxiao Zheng, Zhuohan Li, Zac Frady, Eric P. Xing, Joseph E. Gonzalez, Ion Stoica · Advances in Neural Information Processing Systems (NeurIPS) (2023)

benchmark2023foundationalartifactsAvailable

Temel Katkı (Principal Contribution)

Kitle kaynaklı kör A/B Chatbot Arena ve LLM-as-a-Judge protokolünü oluşturarak dil modellerinin değerlendirilmesinde Bradley-Terry Elo derecelendirmelerini benimsedi.

Operasyonel ve Mühendislik Uygunluğu

task-text-generation, task-model-evaluation için yetkili teorik ve ampirik referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Matematiksel dışbükeylik, düzenlilik ve ampirik tutarlılık problem konfigürasyonlarında geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Teorik sınırlar ve kıyaslama doygunluk özellikleri model mimarileri ve eğitim ölçekleri arasında farklılık gösterir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: