Skip to main content

> ML_ARCHITECTURE // AUTOREGRESSIVE-DECODER-TRANSFORMER_v1.0

Autoregressive Decoder-Only Transformer (GPT / LLaMA / Mistral)

Üretici metin ve kod için baskın temel model mimarisi; nedensel dikkat maskeleri, RoPE konumsal kodlamaları, SwiGLU aktivasyonları ve RMSNorm ile dizileri işler.

Transformerstextcode
Tüm Mimarilere Dön

Mimari Özeti ve Temel Özellikler

Üretici metin ve kod için baskın temel model mimarisi; nedensel dikkat maskeleri, RoPE konumsal kodlamaları, SwiGLU aktivasyonları ve RMSNorm ile dizileri işler.

Uygulayıcı Kütüphaneler

TransformersHugging Face · v4.44.2
İncele
vLLMvLLM Project / UC Berkeley · v0.6.2
İncele
SGLangLMSYS Org / UC Berkeley · v0.3.1
İncele
llama.cppGeorgi Gerganov / Open Source · vb3650
İncele

Temel Literatür (Seminal Papers)

Improving Language Understanding by Generative Pre-Training (GPT-1)Alec Radford, Karthik Narasimhan (2018) · OpenAI Technical Report
LLaMA: Open and Efficient Foundation Language ModelsHugo Touvron, Thibaut Lavril (2023) · arXiv preprint
Mistral 7BAlbert Q. Jiang, Alexandre Sablayrolles (2023) · arXiv preprint
Mimari Kısıtlar ve Sınırlamalar
  • Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.