Skip to main content

> ML_KUTUPHANE // LLAMA-CPP_v1.0

llama.cpp

Georgi Gerganov / Open Source — Verimli yerel çıkarım için C/C++ ile yazılmış LLaMA motoru.

serving-inferencevb3650MITqualified

Model Eğitimi (Training)

Desteklenmiyor

Bu kütüphane optimize edilmiş bir inference motorudur; model eğitimi için kullanılmaz.

Model Sunumu (Inference)

Destekleniyor
Inference Hızlandırıcıları:
CPUCUDAROCMMPSWEBGPUWASM
Hedef Ortamlar (Targets):server, edge, mobile, browser
Kuantizasyon Formatları:GGUF (Q4_K_M, Q5_K_M, Q8_0, IQ2_XXS, IQ4_NL)

Neleri Sağlar (Ne Yapar)

  • +Sıfır bağımlılıkla saf C/C++ uygulaması
  • +Apple Silicon Metal birleşik bellek mimarisi için birinci sınıf hızlandırma
  • +GGUF formatıyla 2-bit'ten 8-bit'e kadar yüksek kaliteli tamsayı kuantalama

Neleri Sağlamaz (Ne Yapmaz)

  • -Temel modelleri sıfırdan eğitme
  • -Büyük sunucu kümelerinde vLLM'in çok kiracılı eşzamanlı istek verimine ulaşma
  • -Klasik tablo modellerini sunma

>Uygun İş Tipleri

  • macOS/Windows/Linux üzerinde yerel LLM geliştirme ve gizli masaüstü çıkarımı
  • Gömülü uç aygıtlar (Raspberry Pi, endüstriyel PC'ler)
  • Mac Studio gibi Apple Silicon sistemlerde birleşik bellekle 70B modelleri yerel çalıştırma

>Uygun Olmayan İş Tipleri

  • Yüzlerce eşzamanlı kullanıcı akışına hizmet veren bulut kurumsal sistemler (vLLM tercih edin)
  • Yapay sinir ağı türev araştırmaları
Veri Yerleşimi ve İkameti

%100 çevrimdışı ve kapalı ağda yerel ana makine belleğinde çalışır.

Güvenlik Değerlendirmesi

GGUF başlık doğrulamalı güvenli bir ikili formattır; Python açıklarına karşı tamamen korunaklıdır.

Operasyonel Metrikler ve Bilinen Kısıtlar

Olgunluk:mature
Öğrenme Eğrisi:low
Operasyon Yükü:low
Maliyet Seviyesi:free-oss
> Bilinen Kısıtlamalar:
  • Yüksek eşzamanlı toplu istekler altında verim vLLM'e kıyasla düzleşir.
  • SafeTensors'tan GGUF'a model dönüşümü manuel bir Python betiği adımı gerektirir.

İlişkili Üretim Arıza Paternleri (Incidentpedia)

Bu kütüphaneyi üretimde kullanırken aşağıdaki arıza senaryolarına karşı fail-closed korumalar uygulayın:

> Birincil Kanıt ve Doğrulama Kaynakları

llama.cpp Official Repositoryrepository • >=b2500, <=b3650
2026-09-25HIGH