Skip to main content

> ML_ALGORITHM // DIRECT-PREFERENCE-OPTIMIZATION-DPO_v1.0

Doğrudan Tercih Optimizasyonu (DPO)

RLHF'teki ayrı ödül modelini analitik olarak ortadan kaldırarak dil modellerini doğrudan eşleştirilmiş insan tercihleri üzerinde optimize eden hizalama algoritması.

RL from Human Feedback (RLHF / Alignment)reinforcement-learningblack-boxlarge (>100k)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(epochs * batch_size * (policy_pass + reference_pass))
Çıkarım (Inference):O(policy_forward)
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:large (>100k)

Açıklanabilirlik Değerlendirmesi

Ayrı ve kararsız bir ödül modeli eğitmeyi gerektirmeden dil modeli politikasını doğrudan optimize eder.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
llm alignment rlhftext generationpreference tuning
Desteklenen Modaliteler:
text

Uygulayıcı Kütüphaneler

TRLHugging Face · v0.10.1
İncele
TransformersHugging Face · v4.44.2
İncele
torchtune

Temel Literatür & Yayınlar

Direct Preference Optimization: Your Language Model Is Secretly a Reward Model (DPO)Rafael Rafailov, Archit Sharma (2023) · Advances in Neural Information Processing Systems (NeurIPS)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Model insan değerlendiricilerin uzunluğu kaliteyle ilişkilendirmesi nedeniyle uzun yanıtlar üreterek uzunluk yanlılığını istismar eder
  • Beta düzenlileştirme parametresi çok düşük ayarlanırsa (<0.05) tercih çiftlerine hızla aşırı uyum sağlar