> tpl_air_030
Bilgi Getirme (Retrieval) Stratejisi ve Test Şartnamesi
Yoğun anlamsal aramayı, seyrek sözlüksel BM25 eşleştirmesini, Karşılıklı Sıralama Birleştirmeyi (RRF), çapraz kodlayıcı yeniden sıralamayı (re-ranking), sorgu genişletmeyi (HyDE) ve otomatik Recall@k / NDCG@k test paketlerini kurallara bağlayan kurumsal hibrit bilgi getirme mimarisi ve ampirik test şartnamesi.
Yoğun/seyrek birleştirmeyi, çapraz kodlayıcı yeniden sıralamayı ve otomatik NDCG@k testlerini kurallara bağlayan bilgi getirme şartnamesi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Yalnızca vektör tabanlı ilkel arama; tam eşleşen anahtar kelimelerde, kısaltmalarda ve ürün kodlarında başarısız olur; ilgisiz anlamsal komşuları getirerek modeli doğru yanıt vermek için gereken gerçek olgulardan yoksun bırakır.
Ne Zaman Kullanılmalı?
- •Yoğun vektör gömmeleri ile seyrek anahtar kelime aramasını birleştiren kurumsal bir RAG getirme mimarisi tasarlarken veya yükseltirken
- •İstem enjeksiyonu öncesinde ilk adayların alaka düzeyini hassaslaştırmak için çapraz kodlayıcı yeniden sıralama (re-ranking) uygularken
- •Referans soru-belge test kümeleri genelinde Recall@k, MRR@k ve NDCG@k değerlerini ölçen otomatik regresyon testleri kurarken
Ne Zaman Kullanılmamalı?
- •Bağımsız gömme modellerini ve boyutsal MTEB testlerini değerlendirirken (TPL-AIR-028 kullanın)
- •Belge parçalama (chunking) stratejilerini ve belirteç sınırı testlerini tasarlarken (TPL-AIR-027 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
Yoğun vektör aramasını (ilk 50) seyrek sözlüksel BM25 aramasıyla (ilk 50) birleştirme. Skor ölçek farklarını gidermek için k=60 sabitiyle Karşılıklı Sıralama Birleştirmeyi (RRF) kullanma.
Getirme öncesi sorgu zenginleştirme: Belirsiz sorular için Varsayımsal Belge Gömmeleri (HyDE), çok yönlü istemler için çoklu sorgu üretimi ve karşılaştırmalı sorular için alt sorgu ayrıştırma.
Aday alaka düzeyini puanlamak için derin çapraz kodlayıcı yeniden sıralayıcıların (Cohere Rerank / BGE) kullanımı. En alakalı ilk 5 parçayı seçme ve alaka puanı < 0,65 olan parçaları eleme.
Matematiksel getirme kalite metrikleri: Hit Rate @ k, Ortalama Karşılıklı Sıralama (MRR @ 10) ve Normalize Edilmiş İndirimli Kümülatif Kazanç (NDCG @ 10). Referans test kümeleriyle sürekli CI testleri.
Gecikme paylaştırma: Vektör arama (50ms), BM25 arama (40ms), RRF birleştirme (10ms), Rerank (120ms), Toplam getirme bütçesi (< 250ms). Sık sorulan sorular için anlamsal önbellekleme (Redis/GPTCache).
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
Bilgi Getirme (Retrieval) Stratejisi ve Test Şartnamesi - Örnek Vaka Analizi
Örnek Organizasyon: Kurumsal Hukuk ve Mevzuat Yapay Zekâ Arama Motoru
Kurumsal Hukuk ve Mevzuat Yapay Zekâ Arama Motoru için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •Karşılıklı Sıralama Birleştirmeyi (RRF) kullanarak yoğun gömmeleri BM25 ile birleştirdi ve getirme hassasiyetini %34 artırdı
- •Cohere çapraz kodlayıcı yeniden sıralama ve alaka eşiği filtreleriyle LLM halüsinasyonlarını %62 azalttı
- •1.200 doğrulanmış hukuki sorgu kümesinde her gece otomatik çalışan NDCG@10 ve Recall@5 regresyon testleri kurdu
Sıkça Sorulan Sorular
Saf vektör anlamsal araması kurumsal ortamlarda neden sıklıkla yetersiz kalır?
Yoğun vektör gömmeleri harf dizilerini değil, genel kavramsal anlamı temsil eder. Kurumsal ortamda kullanıcılar sıklıkla hata kodları ("ERR-4091"), yasa maddeleri ("Madde 409A") veya ürün kodları arar. Vektör modelleri bu dizileri anlamsız belirteçler olarak görüp ilgisiz belgeler getirebilir. Yoğun vektörleri sözlüksel BM25 aramasıyla birleştiren hibrit model bu sorunu kalıcı olarak çözer.
Karşılıklı Sıralama Birleştirme (RRF) farklı arama algoritmalarının puanlarını nasıl birleştirir?
Vektör araması kosinüs benzerliği puanı (0,6-0,9) üretirken, BM25 sınırsız sözlüksel puanlar (5-45) üretir. Bu puanları doğrudan toplamak dengesiz sonuçlar doğurur. RRF ham puanları yok sayar ve her iki listedeki sıralama basamaklarının çarpmaya göre tersini toplar: RRF Puanı = Toplam( 1 / (k + sira_i) ), k=60 kullanılır. Bu, ölçekten bağımsız dengeli bir sıralama sağlar.
Modern RAG hatlarında Çapraz Kodlayıcı Yeniden Sıralayıcının (Cross-Encoder Re-Ranker) rolü nedir?
Çift kodlayıcılar (gömme modelleri) sorgu ve belgeyi bağımsız temsil eder; bu hızlıdır ancak karmaşık etkileşimleri kaçırır. Çapraz kodlayıcı ise sorgu ile aday belgeyi birlikte tüm dikkat (attention) katmanlarından geçirerek tam belirteç etkileşimini hesaplar. Tüm veritabanı için yavaş olsa da ilk 25 aday üzerinde çalıştırıldığında üstün bir alaka hassasiyeti sunar.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Reciprocal Rank Fusion Outperforms Borda Count in Information RetrievalUniversity of Waterloo • OFFICIAL REQUIREMENT
- Cohere Rerank: Deep Cross-Encoder Retrieval ArchitecturesCohere • OFFICIAL REQUIREMENT
- Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE)arXiv / Gao et al. • OFFICIAL REQUIREMENT
