> ML_BENCHMARK // LMSYS-CHATBOT-ARENA-ELO_v1.0
LMSYS Chatbot Arena (Crowdsourced Human Preference Elo)
Chat & Alignment · task-text-generation · active-headroom
Chat & Alignmentactive-headroommoderate
Değerlendirme Protokolü
Rastgele model eşleştirmeleri ve istatistiksel önyükleme ile keyfi kullanıcı istemlerinde kör yan yana insan A/B testi.
Temel Model & Metrikler
Kanonik Temel (Baseline):GPT-4o: ~1330 Elo | Claude 3.5 Sonnet: ~1335 Elo | Gemini 1.5 Pro: ~1300 Elo
Değerlendirilen Metrikler:
Bradley-Terry Arena Elo Rating
Eğitim Verisi Kirliliği ve Sızıntı
Sorgular canlı küresel insan kullanıcılardan dinamik olarak geldiği için sıfıra yakın kirlilik.
Tekrarlanabilirlik Endişeleri
Canlı insan oylayıcı dağılımına, istem uzunluğu yanlılığına ve stil varyasyonlarına bağlıdır.
BAĞLANTILI VERİ KÜMESİLMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation DatasetConversational AI & User Intent · 1 million real-world user conversations with 25 frontier LLMs collected from Chatbot Arena
Veri Kümesini İncele