Skip to main content

> tpl_air_011

Temel Model (Foundation Model) Değerlendirme ve Kıyaslama Paketi

Temel modeller ve LLM'ler için standart yetenekleri (MMLU, GSM8K, HumanEval, HELM), alana özgü görev doğruluğunu, gecikme/işlem hacmi eğrilerini, bağlam penceresi bozulmasını ve token çıkarım ekonomisini değerlendiren ampirik değerlendirme ve kıyaslama çerçevesi.

TEMPLATE // INSPECT: TPL-AIR-011MODIFIED: 2026-09-19
KATEGORİÜretken Yapay Zekâ, RAG ve Ajanlar
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIXLS
FORMATLARPDF, MD, MERMAID, SVG, XLSX
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

LLM'leri standart görevlerde (MMLU, GSM8K), alan doğruluğunda, gecikmede ve token ekonomisinde değerlendiren ampirik kıyaslama paketi.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Mühendislik ekipleri temel modelleri kendi özel veri kümeleri üzerinde ampirik kıyaslama yapmak yerine sağlayıcı pazarlama iddialarına göre seçer; bu da ciddi halüsinasyonlara, yüksek gecikmeye ve bütçe patlamalarına yol açar.

Ne Zaman Kullanılmalı?

  • Kurumsal benimseme için aday temel modelleri (GPT-4o, Claude 3.5 Sonnet, Llama 3.3, Mistral Large, DeepSeek) değerlendirirken
  • Özel alan doğruluğunu, olgusal hatırlamayı ve halüsinasyon oranlarını altın test kümesi üzerinde ölçerken
  • Saniye başına token hızını, ilk token süresini (TTFT) ve bağlam penceresinde samanlıkta iğne arama (needle-in-a-haystack) güvenilirliğini kıyaslarken

Ne Zaman Kullanılmamalı?

  • Canlı üretim LLM kayması ve telemetri izlemesinde (TPL-AIR-021 kullanın)
  • Yapılandırılmış tablosal tahminsel makine öğrenimi modeli doğrulamasında (TPL-AIM-020 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Standart Yetenek Kıyaslamaları ve Görev Taksonomisistandard, enterprise

Aday modellerin akademik standart testlerde değerlendirilmesi: MMLU (Genel Bilgi), GSM8K (Matematik), HumanEval (Kodlama) ve HELM.

Yönerge:Yalnızca genel kıyaslamalara güvenmeyin; halka açık modeller sıklıkla test seti kirlenmesinden (contamination) etkilenir.
2. 2. Alana Özgü Altın Veri Kümesi Küratörlüğü ve Değerlendirmestandard, enterprise

Gerçek müşteri sorularını, uç durumları ve sektörel jargonu içeren 500 örnekli özel altın test kümelerinin oluşturulması.

Yönerge:Doğruluğu, LLM tabanlı hakem rubrikleri, deterministik JSON testleri ve uzman insan kontrolleri kombinasyonuyla ölçün.
3. 3. Uzun Bağlamda Samanlıkta İğne Arama ve Geri Getirme Sadakatistandard, enterprise

Bağlam bozulmasını ve dikkat kayıplarını tespit etmek için 8k, 32k, 128k ve 200k token seviyelerinde hatırlama testleri.

Yönerge:"Ortada kaybolma" (lost in the middle) etkisini yakalamak için hedefleri bağlamın farklı derinliklerine (%10, %50, %90) yerleştirin.
4. 4. Performans, Eşzamanlılık ve Donanım Çıkarım Boyutlandırmasıstandard, enterprise

İlk Token Süresi (TTFT), tokenler arası gecikme (ITL), eşzamanlı kullanıcı hacmi ve GPU VRAM gereksinimlerinin kıyaslanması.

Yönerge:Gecikme testlerini tekil isteklerle değil, yoğun kullanıcı yükü (örn. 100 eşzamanlı akış isteği) altında çalıştırın.
5. 5. Toplam Sahip Olma Maliyeti (TCO) ve Token Birim Ekonomisistandard, enterprise

Girdi/çıktı token fiyatlandırması, önbellek isabet indirimleri, kurum içi GPU altyapı maliyetleri ve ROI amortisman modellemesi.

Yönerge:Yıllık maliyeti gerçek çıktı token oranlarına göre hesaplayın; çıktı tokenleri genellikle girdi tokenlerinden 3-4 kat daha pahalıdır.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

Temel Model (Foundation Model) Değerlendirme ve Kıyaslama Paketi - Örnek Vaka Analizi

Örnek Organizasyon: Kurumsal Hukuk Zekâsı Temel Model Kıyaslama ve Boyutlandırma Çalışması

Kurumsal Hukuk Zekâsı Temel Model Kıyaslama ve Boyutlandırma Çalışması için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • 6 öncü ve açık ağırlıklı model, 600 dokümanlık karmaşık sözleşme akıl yürütme altın test kümesinde kıyaslandı
  • Claude 3.5 Sonnet'in sözleşme veri çıkarma görevinde %94,2 doğruluk sağlayarak diğer modelleri geride bıraktığı kanıtlandı
  • Düşük karmaşıklıktaki özetleme işleri ince ayarlı Llama 3.3 70B modeline yönlendirilerek yılda 280.000 dolar tasarruf edildi

Sıkça Sorulan Sorular

Yüksek MMLU puanı alan modeller neden kurumsal canlı ortamlarda sıklıkla başarısız olur?

Standart akademik testler genel ansiklopedik bilgiyi, okul matematiğini ve genel kodlama sorularını ölçer. Kurumsal uygulamalar ise genel testlerin yansıtmadığı şirket içi şemalara, yasal taksonomilere ve kurumsal jargona dayalı ince akıl yürütme gerektirir.

Kendi modelini kayırma yanlılığını (self-enhancement) önlemek için LLM hakemleri nasıl kalibre edilmelidir?

LLM hakemleri genellikle kendi model ailesinin ürettiği yanıtları üstün tutar. Kalibrasyon için çapraz aile hakemleri kullanın (örn. Claude yanıtlarını GPT-4 ile puanlama), seçenek sıralamasını rastgeleleştirin, az sayıda örnek içeren rubrikler verin ve çıktıların %10-15'ini uzman insanlarla denetleyin.

İlk Token Süresi (TTFT) nedir ve kullanıcı deneyimi için neden hayatidir?

TTFT, istemin gönderilmesi ile ilk akış karakterinin ekrana gelmesi arasında geçen süredir. Etkileşimli kurumsal uygulamalarda (yardımcı asistanlar, sohbet botları) TTFT algılanan sistem hızını belirler; 1.500 ms'yi aşan TTFT sonraki üretim hızı ne olursa olsun kullanıcıya sistemi yavaş hissettirir.

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Blank-EN.xlsxXLSX
all10.0 KB
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Example-EN.xlsxXLSX
all10.1 KB
TPL-AIR-011-Temel-Model-Foundation-Model-De-erlendirme-ve-K-yaslama-Paketi-Bos-TR.xlsxXLSX
all10.0 KB
TPL-AIR-011-Temel-Model-Foundation-Model-De-erlendirme-ve-K-yaslama-Paketi-Ornek-TR.xlsxXLSX
all10.0 KB
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Blank-EN.pdfPDF
all103.2 KB
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Example-EN.pdfPDF
all104.5 KB
TPL-AIR-011-Temel-Model-Degerlendirme-ve-Kiyaslama-Paketi-Bos-TR.pdfPDF
all102.0 KB
TPL-AIR-011-Temel-Model-Degerlendirme-ve-Kiyaslama-Paketi-Ornek-TR.pdfPDF
all102.1 KB
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Blank-EN.mdMD
all2.3 KB
TPL-AIR-011-Foundation-Model-Evaluation-and-Benchmark-Pack-Example-EN.mdMD
all2.4 KB
TPL-AIR-011-Temel-Model-Degerlendirme-ve-Kiyaslama-Paketi-Bos-TR.mdMD
all2.5 KB
TPL-AIR-011-Temel-Model-Degerlendirme-ve-Kiyaslama-Paketi-Ornek-TR.mdMD
all2.6 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir

Yetkili Standartlar ve Kaynaklar