Skip to main content

> ML_LITERATURE // CHRISTIANO-2017-DEEP-REINFORCEMENT-LEARNING-HUMAN-PREFERENCES_v1.0

Deep Reinforcement Learning from Human Preferences

Paul F. Christiano, Jan Leike, Tom B. Brown, Miljan Martic, Shane Legg, Dario Amodei · Advances in Neural Information Processing Systems (NeurIPS) (2017)

foundational2017industry-standardthirdPartyReproduced

Temel Katkı (Principal Contribution)

Davranış yörüngelerinin ikili insan tercihi karşılaştırmalarına öğrenilen bir ödül tahmincisi uydurarak biçimsel ödül mühendisliği olmadan karmaşık görevleri çözen RLHF'yi formüle etti.

Operasyonel ve Mühendislik Uygunluğu

task-reinforcement-learning için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.

Temel Varsayımlar (Assumptions)

  • Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: