Skip to main content

> ML_RECIPE // ENTERPRISE-TECHNICAL-DOCUMENTATION-RAG_v1.0

Kurumsal Teknik Dokümantasyon RAG

Mühendislerin ve destek ekiplerinin kurum içi rehberleri ve mimari belgeleri doğrulanabilir alıntılarla sorgulamasını sağlamak.

semantic search ragsaas ecommerceApache-2.0moderate-cloud
Tüm Tariflere Dön

İş Hedefi ve Beklenen Çıktı

Mühendislerin ve destek ekiplerinin kurum içi rehberleri ve mimari belgeleri doğrulanabilir alıntılarla sorgulamasını sağlamak.

Kabul Kriteri (Acceptance Criteria):

Zero hallucinated links or invented commands permitted on technical procedures.

Sezgisel Temel (Heuristic Baseline)

En çok eşleşen belge parçalarını döndüren tam metin anahtar kelime araması (Elasticsearch / PostgreSQL BM25).

Temel Model Performansı:

BM25 keyword search achieves Context Precision 0.58 and frequently misses semantic paraphrases.

Aşama 1: Prototip Geliştirme Yolu

Markdown/PDF belgelerini 500 tokenlık parçalara ayırın. sentence-transformers ile embedding oluşturup bellek içi vektör indeksinde arayın.

Donanım: Developer workstation with 16GB RAM

Aşama 2: Üretim Dağıtım Yolu

Webhook pipeline ile belgeleri pgvector içine sürekli senkronize edin. Embedding çıkarımlarını CPU üzerinde ONNX Runtime, metin üretimini konteyner vLLM ile çalıştırın.

Donanım: Server with 1x NVIDIA A10G/L4 (24GB VRAM) for vLLM, or CPU host with external private API

Hesaplama ve Dağıtım Mimarisi (Placement Topologies)

Eğitim Dağıtımı (Training Placement)

Hazır pretrained modeller; sıfır custom model training maliyeti

Çıkarım Dağıtımı (Inference Placement)

CPU server üzerinde embedding üretimi; vLLM GPU server veya güvenli hosted API üzerinden LLM sentezi

3 Kademeli Dağıtım Seçenekleri (Placement Alternatives)

Plan A: En Basit Yaşayabilir (Simplest)

Sıkı parça alıntılarıyla barındırılan LLM API (OpenAI/Anthropic) kullanan bellek içi vektör indeksi.

Plan B: Donanıma Uygun (Hardware-Fitted)

Kurum içi özel çıkarım için kuantize Mistral/Llama ile vLLM çalıştıran tek GPU sunucusu (1x NVIDIA L4 veya RTX 4090).

Plan C: Üretime Hazır (Production-Ready)

Okuma kopyalı pgvector depolama + CPU ONNX Runtime embedding mikroservisi + Ragas değerlendirmesi ve alıntı doğrulama kapılı adanmış GPU kümesinde konteynerleştirilmiş vLLM.

Önerilen Kütüphaneler & Araçlar

★ BİRİNCİL KÜTÜPHANETransformersHugging Face
İncele
vLLMvLLM Project / UC Berkeley
İncele
Transformers.jsHugging Face
İncele
Sentence TransformersHugging Face / UKP Lab
İncele

Yönetişim, Güvenceler ve Riskler

Yönetişim Kuralları:
  • Katı alıntı zorunluluğu: her üretilen yanıt kaynak belgelere tıklanabilir bağlantılar sunmalıdır.
  • Girdi metinlerini prompt injection saldırılarına karşı filtreleyin.
  • Hassas kurum içi belgelerin kullanıcı rol yetkilendirmesiyle (RBAC) filtrelendiğini doğrulayın.