Skip to main content

> ML_BENCHMARK // LMSYS-CHATBOT-ARENA-ELO_v1.0

LMSYS Chatbot Arena (Crowdsourced Human Preference Elo)

Chat & Alignment · task-text-generation · active-headroom

Chat & Alignmentactive-headroommoderate

Değerlendirme Protokolü

Rastgele model eşleştirmeleri ve istatistiksel önyükleme ile keyfi kullanıcı istemlerinde kör yan yana insan A/B testi.

Temel Model & Metrikler

Kanonik Temel (Baseline):GPT-4o: ~1330 Elo | Claude 3.5 Sonnet: ~1335 Elo | Gemini 1.5 Pro: ~1300 Elo
Değerlendirilen Metrikler:
Bradley-Terry Arena Elo Rating

Eğitim Verisi Kirliliği ve Sızıntı

Sorgular canlı küresel insan kullanıcılardan dinamik olarak geldiği için sıfıra yakın kirlilik.

Tekrarlanabilirlik Endişeleri

Canlı insan oylayıcı dağılımına, istem uzunluğu yanlılığına ve stil varyasyonlarına bağlıdır.

BAĞLANTILI VERİ KÜMESİLMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation DatasetConversational AI & User Intent · 1 million real-world user conversations with 25 frontier LLMs collected from Chatbot Arena
Veri Kümesini İncele