Skip to main content

> ML_LITERATURE // GERGANOV-2023-LLAMACPP-PORT-OF-LLAMA-MODEL-IN-C-CPP_v1.0

llama.cpp: Inference of LLaMA model in pure C/C++

Georgi Gerganov · GitHub Technical Report / Open-Source System (2023)

systems2023industry-standardnotAssessed

Temel Katkı (Principal Contribution)

AVX2/AVX-512, ARM NEON ve Metal GPU boşaltma ile saf C/C++ sıfır bağımlılıklı kuantalanmış çıkarım uygulayarak cihaz üzerinde evrensel LLM çalıştırması için GGUF formatını oluşturdu.

Operasyonel ve Mühendislik Uygunluğu

Üretim sistemlerinde task-text-generation uygulaması için yetkili referans olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Temel hesaplama topolojisi ve matematiksel sınırlar belirlenmiş dışbükeylik/pürüzsüzlük garantilerine uygundur

Kısıtlar ve Sınırlamalar (Limitations)

  • Donanım hızlandırmaları, gizlilik bütçeleri ve yakınsama hiperparametrelere ve ağ iletişim limitlerine bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: