> tpl_air_028
Gömme (Embedding) Modeli Değerlendirme ve Seçim Paketi
MTEB getirme doğruluğunu, boyutsal büyüklüğü (384 - 3072 boyut), Matryoshka boyut kısaltmasını, çıkarım gecikmesini, çok dillilik kabiliyetini ve belirteç fiyatlandırmasını değerlendiren yoğun ve seyrek vektör gömmeleri karar matrisi ve kıyaslama çalışma kitabı.
MTEB kıyaslamalarını, boyutsal büyüklükleri, gecikmeyi ve barındırma maliyetlerini karşılaştıran gömme modeli değerlendirme paketi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Ekipler kendi alanlarındaki performansı test etmeden pahalı tescilli bulut modellerini seçer; bu da vektör veritabanı RAM maliyetlerini patlatan ve sektörel kısaltmalarda başarısız olan 3072 boyutlu vektörlere kilitlenmelerine neden olur.
Ne Zaman Kullanılmalı?
- •Kurumsal anlamsal arama için en uygun gömme modelini (OpenAI, Cohere, Voyage, BGE) seçerken
- •Vektör boyutlarını sıkıştırıp (%60+ RAM tasarrufu) Matryoshka Representation Learning (MRL) modellerini değerlendirirken
- •Hibrit arama için yoğun anlamsal modelleri seyrek sözcüksel modellerle (BM25 / SPLADE) kıyaslarken
Ne Zaman Kullanılmamalı?
- •Metin üretimi veya muhakeme için büyük dil modellerini (LLM) değerlendirirken (TPL-AIR-011 kullanın)
- •Vektör veritabanı altyapı seçimi, kümeleme ve indeks ayarlarında (TPL-AIR-029 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
Model sınıflandırması: Yoğun Anlamsal Gömmeler (kavramsal anlam), Seyrek Sözcüksel Temsiller (BM25, SPLADE: tam anahtar kelime eşleşmesi) ve Geç Etkileşim Modelleri (ColBERT).
MTEB liderlik tablosu analizi: Getirme (NDCG@10), Anlamsal Metin Benzerliği (STS), Sınıflandırma ve Yeniden Sıralama. Sektörel terimlerin doğrulanması.
Vektör boyutunun bellek maliyetine etkisi: 384 boyut (düşük RAM), 768/1024 boyut (standart), 1536/3072 boyut (yüksek maliyet). <%2 kayıpla kısaltılabilen MRL modelleri.
Operasyonel performans: Toplu işlem hızı, çıkarım gecikmesi (ms/sorgu) ve barındırma tercihleri (kendi GPU'nda Hugging Face TEI ve OpenAI/Cohere API'leri).
6 ağırlıklı boyutta puanlama: Getirme Doğruluğu (%30), 1M Belirteç Maliyeti (%20), Çok Dillilik Yeteneği (%20), Gecikme (%15) ve Ekosistem Uyumu (%15).
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
Gömme (Embedding) Modeli Değerlendirme ve Seçim Paketi - Örnek Vaka Analizi
Örnek Organizasyon: Küresel Finansal Mevzuat İstihbaratı ve Uyum Arama Platformu
Küresel Finansal Mevzuat İstihbaratı ve Uyum Arama Platformu için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •120.000 mevzuat belgesinde 7 lider gömme modelini kıyaslayarak üstün sıralama başarısı için Cohere Embed v3 modelini seçti
- •Matryoshka boyut kısaltması ile vektörleri 1536'dan 512 boyuta indirerek yıllık 84.000 dolarlık bulut RAM maliyeti tasarrufu sağladı
- •Karışık Türkçe ve İngilizce hukuki metinlerde %94,2 NDCG@10 getirme başarısı elde etti
Sıkça Sorulan Sorular
Matryoshka Temsil Öğrenimi (MRL) nedir ve altyapı maliyetlerinden nasıl tasarruf sağlar?
Geleneksel gömmeler anlamsal bilgiyi tüm vektör boyutlarına rastgele dağıtır. MRL ise en kritik bilgiyi ilk N boyutta (ör. 1536 boyutun ilk 512'sinde) toplar. Bu sayede vektörleri orijinal boyutlarının üçte birine kısaltabilir, doğruluk kaybı olmadan veritabanı RAM maliyetini %66 azaltabilirsiniz.
Kurumsal arama sistemleri Yoğun Gömmeleri neden Seyrek (BM25) Sözcüksel aramayla birleştirmelidir?
Yoğun gömmeler kavramsal anlamsal aramada harikadır (ör. "kalp yetmezliği" ile "kardiyak arrest" eşlemesi) ancak hata kodları, parça numaraları veya kanun maddeleri ("CVE-2024-38077") gibi tam eşleşmelerde zayıftır. Yoğun ve BM25'i birleştiren Hibrit Arama her iki dünyanın da en iyisini sunar.
Belirteçleyici (tokenizer) kelime dağarcığı Türkçe gibi dillerde gömme kalitesini nasıl etkiler?
Yalnızca İngilizce ağırlıklı modeller Türkçe kelimeleri 4-5 küçük alt parçaya böler; bu da belirteç bütçesini tüketir, gecikmeyi artırır ve anlamı bozar. Cohere veya BGE-M3 gibi gerçek çok dilli modeller, 250.000+ kelimelik dağarcıklarıyla diller arası kusursuz anlamsal temsil sunar.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Hugging Face MTEB Leaderboard: Massive Text Embedding BenchmarkHugging Face • OFFICIAL REQUIREMENT
- Cohere: Embed v3 Documentation & Compression BenchmarksCohere • OFFICIAL REQUIREMENT
- Matryoshka Representation Learning (Kusupati et al., NeurIPS 2022)NeurIPS • OFFICIAL REQUIREMENT
