> ML_LITERATURE // ZHENG-2023-JUDGING-LLM-AS-A-JUDGE-MT-BENCH-CHATBOT-ARENA_v1.0
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Lianmin Zheng, Wei-Lin Chiang, Hao Zhang, Siyuan Zhuang, Yonghao Zhuang, Lingxiao Zheng, Zhuohan Li, Zac Frady, Eric P. Xing, Joseph E. Gonzalez, Ion Stoica · Advances in Neural Information Processing Systems (NeurIPS) (2023)
benchmark2023foundationalartifactsAvailable
Temel Katkı (Principal Contribution)
Kitle kaynaklı kör A/B Chatbot Arena ve LLM-as-a-Judge protokolünü oluşturarak dil modellerinin değerlendirilmesinde Bradley-Terry Elo derecelendirmelerini benimsedi.
Operasyonel ve Mühendislik Uygunluğu
task-text-generation, task-model-evaluation için yetkili teorik ve ampirik referans olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Matematiksel dışbükeylik, düzenlilik ve ampirik tutarlılık problem konfigürasyonlarında geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Teorik sınırlar ve kıyaslama doygunluk özellikleri model mimarileri ve eğitim ölçekleri arasında farklılık gösterir
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
