Skip to main content

> ML_LITERATURE // OUYANG-2022-TRAINING-LANGUAGE-MODELS-TO-FOLLOW-INSTRUCTIONS-WITH-HUMAN-FEEDBACK_v1.0

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe · Advances in Neural Information Processing Systems (NeurIPS) (2022)

safety-fairness2022foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

RLHF hizalamasına (SFT + Ödül Modelleme + PPO) öncülük ederek GPT-3'ü insan niyetine hizaladı ve ChatGPT'yi doğurdu.

Operasyonel ve Mühendislik Uygunluğu

Tüm yapay zeka ekosisteminde üretim konuşma asistanları, güvenlik korkulukları ve talimat takibi için kesin reçete.

Temel Varsayımlar (Assumptions)

  • İnsan etiketleyiciler karşılaştırmalı tamamlamaları güvenilir şekilde sıralayabilir ve öğrenilen skaler ödüller bağlamlar arasında genellenir

Kısıtlar ve Sınırlamalar (Limitations)

  • Hizalama vergisi: ham akademik bilgi kıyaslamalarında hafif gerileme; ödül istismarına ve dalkavukluğa karşı savunmasızlık

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: