> ML_LITERATURE // RADFORD-2019-LANGUAGE-MODELS-ARE-UNSUPERVISED-MULTITASK-LEARNERS_v1.0
Language Models are Unsupervised Multitask Learners (GPT-2)
Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever · OpenAI Technical Report (2019)
seminal-architecture2019foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Özbağlanımlı dil modellerini (1,5B parametre) web veri setlerine ölçeklendirmenin, ince ayar olmadan sıfır vuruşlu görev tamamlamayı açığa çıkardığını gösterdi.
Operasyonel ve Mühendislik Uygunluğu
İstem tabanlı sıfır vuruşlu değerlendirme kavramını kanıtlayarak yapay zekayı göreve özel ince ayar başlıklarından uzaklaştırdı.
Temel Varsayımlar (Assumptions)
- Yeterince büyük metin külliyatlarında eğitilen dil modelleri, yalnızca doğal dil istemlerine koşullanarak alt görevleri çözmeyi öğrenmeye başlar
Kısıtlar ve Sınırlamalar (Limitations)
- Halüsinasyon, olgusal tutarsızlık ve istem formülasyonuna duyarlılık; güvenlik hizalaması eksikliği
