> tpl_air_026
RAG Veri Alma ve Dönüştürme Şartnamesi
Geri Getirmeyle Zenginleştirilmiş Üretim (RAG) hatları için çok modlu belge ayrıştırma (PDF, DOCX, HTML), üstveri zenginleştirme, tablo düzeni çıkarma, OCR yedekleri ve PII temizliğini kurallara bağlayan yüksek verimli belge alma ve normalizasyon şartnamesi.
Çok modlu ayrıştırmayı, tablo çıkarmayı, üstveri zenginleştirmeyi ve PII temizliğini standartlaştıran RAG veri alma şartnamesi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
RAG sistemleri ham PDF'leri sayfa düzenini anlamadan içeri alır; tabloları anlamsız cümlelere böler, başlıkları yoksayar, kişisel verileri (PII) dizinler ve modellere bozuk bağlam besleyerek halüsinasyonlara ve veri sızıntılarına yol açar.
Ne Zaman Kullanılmalı?
- •RAG tabanlı kurumsal bilgi asistanları için belge alma hatlarını tasarlarken veya yükseltirken
- •Karmaşık PDF'ler, taranmış raporlar, finansal tablolar ve şirket içi vikiler için standart çıkarma kuralları koyarken
- •Vektör veritabanına gömme oluşturmadan önce otomatik PII temizliği (Presidio/Regex) uygularken
Ne Zaman Kullanılmamalı?
- •Gömme modellerini ve boyutsal ödünleşimleri değerlendirirken (TPL-AIR-028 kullanın)
- •Parçalama (chunking) deneyleri ve belirteç örtüşme parametrelerini tasarlarken (TPL-AIR-027 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
Asenkron veri alma motoru: S3/Blob depolama dinleyicileri, webhook tetikleyicileri, kuyruk ayrıştırma (Kafka/SQS), çalışan düğüm ölçekleme ve güncellemeler için idempotentlik.
Ayrıştırıcı yönlendirme: Karmaşık PDF'ler için görsel modeller veya sayfa düzeni ayrıştırıcıları (LlamaParse), taranmış belgeler için OCR, şirket içi vikiler için HTML DOM ayrıştırıcılar.
Parçalara değişmez üstveri ekleme: document_id, section_title, source_url, page_number, yazar, tarih ve kullanıcı güvenlik ACL etiketleri (ör. "rol:finans").
Ham metin temizliği: Sayfa üstü/altı bilgileri, çerez uyarıları ve mükerrer paragrafların silinmesi. Otomatik PII temizliği (kredi kartı, TC kimlik, telefon ve kişisel e-postaların anonimleştirilmesi).
Hat sağlığı metrikleri: Belge ayrıştırma başarı oranı (> %99,5), ortalama ayrıştırma süresi, belge başına belirteç sayısı ve bozuk dosyalar için DLQ uyarıları.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
RAG Veri Alma ve Dönüştürme Şartnamesi - Örnek Vaka Analizi
Örnek Organizasyon: Küresel İlaç Araştırması ve Mevzuat İstihbaratı RAG Platformu
Küresel İlaç Araştırması ve Mevzuat İstihbaratı RAG Platformu için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •250.000 klinik araştırma belgesini %99,8 çıkarma doğruluğuyla işleyen otomatik çok formatlı veri alma hattı kurdu
- •18.000 karmaşık tıbbi dozaj tablosunu Markdown formatında çıkararak LLM soru-cevap doğruluğunu %44 artırdı
- •İndeksleme öncesinde Presidio hattı ile hasta kimlik bilgilerini %100 temizleyerek mevzuat riskini sıfırladı
Sıkça Sorulan Sorular
PDF tablolarını düz metne dönüştürmek RAG doğruluğunu neden bozar?
Bir PDF tablosu düz metne çevrildiğinde satır ve sütun ilişkileri kaybolur; yan yana sütunlardaki hücreler anlamsız cümleler halinde birbirine girer. Tabloların Markdown veya HTML olarak korunması, modelin başlık ve satır ilişkilerini doğru anlamasını sağlar.
Kurumsal bir RAG hattında erişim kontrolü (ACL) nasıl uygulanmalıdır?
Kaynak sistemdeki (SharePoint, Drive) erişim yetkileri belge alınırken okunmalı ve parça üstverisine izinli grup kimlikleri dizisi olarak eklenmelidir. Sorgulama anında, arama motoru yalnızca oturum açmış kullanıcının ait olduğu gruplarla eşleşen parçaları getirmelidir.
Modern belge almada OCR'ın (Optik Karakter Tanıma) rolü nedir?
Birçok kurumsal PDF metin katmanı olmayan taranmış görüntülerdir. Altyapı her sayfayı denetlemeli: dijital metin varsa doğrudan almalı, sayfa bir resimse sessiz veri kaybını önlemek için OCR motoruna (Textract/Tesseract) yönlendirmelidir.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Unstructured.io: Core Library for Parsing and Ingesting Unstructured DataUnstructured Technologies • OFFICIAL REQUIREMENT
- LlamaIndex Documentation: Data Connectors and Ingestion PipelineLlamaIndex • OFFICIAL REQUIREMENT
- Microsoft Presidio: Data Protection and De-Identification SDKMicrosoft • OFFICIAL REQUIREMENT
