> ML_LITERATURE // CHRISTIANO-2017-DEEP-REINFORCEMENT-LEARNING-HUMAN-PREFERENCES_v1.0
Deep Reinforcement Learning from Human Preferences
Paul F. Christiano, Jan Leike, Tom B. Brown, Miljan Martic, Shane Legg, Dario Amodei · Advances in Neural Information Processing Systems (NeurIPS) (2017)
foundational2017industry-standardthirdPartyReproduced
Temel Katkı (Principal Contribution)
Davranış yörüngelerinin ikili insan tercihi karşılaştırmalarına öğrenilen bir ödül tahmincisi uydurarak biçimsel ödül mühendisliği olmadan karmaşık görevleri çözen RLHF'yi formüle etti.
Operasyonel ve Mühendislik Uygunluğu
task-reinforcement-learning için mimari kararları, hizalama stratejisini ve sunum altyapısını doğrudan yönlendirir.
Temel Varsayımlar (Assumptions)
- Ampirik dağılım düzenliliği geçerlidir ve hedef alan ön eğitim dilsel/görsel desteğine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Kaynak ölçekleme, çıkarım bellek gereksinimleri ve hizalama sağlamlığı model boyutuna ve donanım topolojisine göre değişir
