> ML_LITERATURE // RADFORD-2018-IMPROVING-LANGUAGE-UNDERSTANDING-GENERATIVE-PRE-TRAINING_v1.0
Improving Language Understanding by Generative Pre-Training (GPT-1)
Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever · OpenAI Technical Report (2018)
seminal-architecture2018foundationalthirdPartyReproduced
Temel Katkı (Principal Contribution)
Farklı etiketsiz metinler üzerinde üretici özbağlanımlı ön eğitimi ve ardından ayırt edici görev ince ayarını kurdu.
Operasyonel ve Mühendislik Uygunluğu
GPT serisinin kökeni, genel NLP görev aktarımı için nedensel özbağlanımlı Transformer kod çözmeyi doğruladı.
Temel Varsayımlar (Assumptions)
- Denetimsiz dil modellemesi, çeşitli denetimli alt görevlere aktarılan etkili bir ön eğitim amacı olarak hizmet eder
Kısıtlar ve Sınırlamalar (Limitations)
- Model ölçeği (117M parametre), ince ayar olmadan sıfır vuruşlu bağlam içi görev yürütme için yetersizdi
