> ML_ARCHITECTURE // AUTOREGRESSIVE-DECODER-TRANSFORMER_v1.0
Autoregressive Decoder-Only Transformer (GPT / LLaMA / Mistral)
Üretici metin ve kod için baskın temel model mimarisi; nedensel dikkat maskeleri, RoPE konumsal kodlamaları, SwiGLU aktivasyonları ve RMSNorm ile dizileri işler.
Transformerstextcode
Tüm Mimarilere DönMimari Özeti ve Temel Özellikler
Üretici metin ve kod için baskın temel model mimarisi; nedensel dikkat maskeleri, RoPE konumsal kodlamaları, SwiGLU aktivasyonları ve RMSNorm ile dizileri işler.
Uygulayıcı Kütüphaneler
Temel Literatür (Seminal Papers)
Improving Language Understanding by Generative Pre-Training (GPT-1)Alec Radford, Karthik Narasimhan (2018) · OpenAI Technical Report
LLaMA: Open and Efficient Foundation Language ModelsHugo Touvron, Thibaut Lavril (2023) · arXiv preprint
Mistral 7BAlbert Q. Jiang, Alexandre Sablayrolles (2023) · arXiv preprint
Mimari Kısıtlar ve Sınırlamalar
- Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.
