Skip to main content

> ML_LITERATURE // RAFAILOV-2023-DIRECT-PREFERENCE-OPTIMIZATION-LANGUAGE-MODELS-IMPLICIT-REWARD_v1.0

Direct Preference Optimization: Your Language Model Is Secretly a Reward Model (DPO)

Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn · Advances in Neural Information Processing Systems (NeurIPS) (2023)

algorithm2023industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

RLHF amacındaki ödül fonksiyonunun kesin kapalı form ikamesini türeterek hizalanmış dil modellerini basit ikili çapraz entropiyle eğitti.

Operasyonel ve Mühendislik Uygunluğu

3 kat daha düşük VRAM ek yükü ve aşırı eğitim kararlılığı nedeniyle açık kaynaklı LLM son eğitiminde PPO'nun yerini büyük ölçüde aldı.

Temel Varsayımlar (Assumptions)

  • Örtük ödül r(x, y) = beta * log(pi(y|x) / pi_ref(y|x)) olarak analitik formüle edilebilir, ayrı bir ödül modeli ihtiyacını ortadan kaldırır

Kısıtlar ve Sınırlamalar (Limitations)

  • Tercih veri seti gürültüsüne duyarlıdır; açık düzenlileştirme olmadan uzunluk istismarı yanlılığına karşı savunmasızdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: