> ML_LITERATURE // OUYANG-2022-TRAINING-LANGUAGE-MODELS-TO-FOLLOW-INSTRUCTIONS-WITH-HUMAN-FEEDBACK_v1.0
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe · Advances in Neural Information Processing Systems (NeurIPS) (2022)
safety-fairness2022foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
RLHF hizalamasına (SFT + Ödül Modelleme + PPO) öncülük ederek GPT-3'ü insan niyetine hizaladı ve ChatGPT'yi doğurdu.
Operasyonel ve Mühendislik Uygunluğu
Tüm yapay zeka ekosisteminde üretim konuşma asistanları, güvenlik korkulukları ve talimat takibi için kesin reçete.
Temel Varsayımlar (Assumptions)
- İnsan etiketleyiciler karşılaştırmalı tamamlamaları güvenilir şekilde sıralayabilir ve öğrenilen skaler ödüller bağlamlar arasında genellenir
Kısıtlar ve Sınırlamalar (Limitations)
- Hizalama vergisi: ham akademik bilgi kıyaslamalarında hafif gerileme; ödül istismarına ve dalkavukluğa karşı savunmasızlık
