Skip to main content

> ML_ALGORITHM // AUTOREGRESSIVE-SELF-SUPERVISED-GPT_v1.0

Nedensel Özbağlanımlı Sonraki Belirteç Tahmini (GPT)

Sonraki belirteç tahmini yoluyla trilyonlarca belirteç üzerinde nedensel Transformer kod çözücülerini eğiterek modern Büyük Dil Modellerini güçlendiren baskın denetimsiz paradigma.

Autoregressive Generative Pre-trainingself-supervisedblack-boxmassive (>10M)
Tüm Algoritmalara Dön
Hesaplama Karmaşıklığı
Eğitim (Training):O(tokens * params * 6 FLOPs)
Çıkarım (Inference):O(kv_cache * layers) memory, O(params * 2 FLOPs) per token
Donanım Karakteristiği
CPU Uygunluğu:Hayır
GPU Zorunluluğu:Evet
Bellek Ayak İzi:high
Açıklanabilirlik ve Veri
Açıklanabilirlik Düzeyi:black-box
Eğitim Verisi İhtiyacı:massive (>10M)

Açıklanabilirlik Değerlendirmesi

Yüksek kapasite karmaşık akıl yürütme zincirlerini mümkün kılar, ancak dahili mekanik yorumlanabilirlik aktif bir araştırma sınırıdır.

Uygun Görevler ve Desteklenen Modaliteler

Uygun Görevler:
text generationcode generationin context learningreasoning
Desteklenen Modaliteler:
textcodemultimodal

Uygulayıcı Kütüphaneler

vLLMvLLM Project / UC Berkeley · v0.6.2
İncele
TransformersHugging Face · v4.44.2
İncele
SGLangLMSYS Org / UC Berkeley · v0.3.1
İncele
TensorRT-LLMNVIDIA · v0.12.0
İncele

Temel Literatür & Yayınlar

Improving Language Understanding by Generative Pre-Training (GPT-1)Alec Radford, Karthik Narasimhan (2018) · OpenAI Technical Report
Language Models are Few-Shot Learners (GPT-3)Tom B. Brown, Benjamin Mann (2020) · Advances in Neural Information Processing Systems (NeurIPS)
Sık Karşılaşılan Hatalar ve Dikkat Edilmesi Gerekenler
  • Geri alma veya doğrulama olmadan olgusal doğruluk varsaymak; özbağlanımlı üretim doğruluktan ziyade belirteç olasılığını optimize eder
  • Sayfalama algoritmaları olmadan doğrusal KV-önbellek genişlemesinin GPU VRAM'ini tüketmesi