> ML_LITERATURE // GERGANOV-2023-LLAMACPP-PORT-OF-LLAMA-MODEL-IN-C-CPP_v1.0
llama.cpp: Inference of LLaMA model in pure C/C++
Georgi Gerganov · GitHub Technical Report / Open-Source System (2023)
systems2023industry-standardnotAssessed
Temel Katkı (Principal Contribution)
AVX2/AVX-512, ARM NEON ve Metal GPU boşaltma ile saf C/C++ sıfır bağımlılıklı kuantalanmış çıkarım uygulayarak cihaz üzerinde evrensel LLM çalıştırması için GGUF formatını oluşturdu.
Operasyonel ve Mühendislik Uygunluğu
Üretim sistemlerinde task-text-generation uygulaması için yetkili referans olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Temel hesaplama topolojisi ve matematiksel sınırlar belirlenmiş dışbükeylik/pürüzsüzlük garantilerine uygundur
Kısıtlar ve Sınırlamalar (Limitations)
- Donanım hızlandırmaları, gizlilik bütçeleri ve yakınsama hiperparametrelere ve ağ iletişim limitlerine bağlıdır
Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler
İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler:
