> ML_LITERATURE // RAFAILOV-2023-DIRECT-PREFERENCE-OPTIMIZATION-LANGUAGE-MODELS-IMPLICIT-REWARD_v1.0
Direct Preference Optimization: Your Language Model Is Secretly a Reward Model (DPO)
Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn · Advances in Neural Information Processing Systems (NeurIPS) (2023)
algorithm2023industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
RLHF amacındaki ödül fonksiyonunun kesin kapalı form ikamesini türeterek hizalanmış dil modellerini basit ikili çapraz entropiyle eğitti.
Operasyonel ve Mühendislik Uygunluğu
3 kat daha düşük VRAM ek yükü ve aşırı eğitim kararlılığı nedeniyle açık kaynaklı LLM son eğitiminde PPO'nun yerini büyük ölçüde aldı.
Temel Varsayımlar (Assumptions)
- Örtük ödül r(x, y) = beta * log(pi(y|x) / pi_ref(y|x)) olarak analitik formüle edilebilir, ayrı bir ödül modeli ihtiyacını ortadan kaldırır
Kısıtlar ve Sınırlamalar (Limitations)
- Tercih veri seti gürültüsüne duyarlıdır; açık düzenlileştirme olmadan uzunluk istismarı yanlılığına karşı savunmasızdır
