Skip to main content

> RAG_MANUAL_02

Kılavuz 02: Doküman Alımı ve Düzen Ayrıştırma

Düzen duyarlı görsel doküman ayrıştırma, OCR hata toleransı, tablo yapısı kurtarma ve parçalama kuralları.

Kanonik Mühendislik Kılavuzu #02|TinyCTO RAG Bible

Doküman Alımı ve Düzen Ayrıştırma

Düzen duyarlı görsel doküman ayrıştırma, OCR hata toleransı, tablo yapısı kurtarma ve parçalama kuralları.

#1. Fiziksel Doküman Ayrıştırma Zorlukları

Basit metin çıkarma araçları (örneğin temel PyPDF), çok sütunlu metinleri yatay satırlar halinde birleştirerek ve karmaşık tablo ilişkilerini bozarak doküman yapısına zarar verir. Kurumsal RAG sistemleri, yapısal hiyerarşiyi koruyan düzen duyarlı (layout-aware) ayrıştırıcılar gerektirir.

Düzen Duyarlı Bölümleme

  • Görsel Destekli Ayrıştırıcılar: Docling veya Marker gibi sistemler, dokümanları anlamsal sınırlayıcı kutulara (başlıklar, paragraflar, tablolar) ayırmak için hafif görsel modeller kullanır.
  • Tablo Yapısının Korunması: Tablo verileri, açık başlık-hücre bağlamlarıyla temiz Markdown veya HTML tablo yapılarına dönüştürülmelidir.
  • Okuma Sırasının Yeniden Oluşturulması: Çok sütunlu düzenler, sayfa sınırı boyunca soldan sağa okunmak yerine sütun bazında dikey olarak ayrıştırılmalıdır.

#2. Parçalama (Chunking) Mimarileri ve Değişmezleri

  1. Örtüşmeli Sabit Boyutlu Parçalama: Standart taban çizgisi (512 token boyut, 64 token örtüşme). Uygulaması kolaydır ancak cümle sınırlarını bölebilir.
  2. Hiyerarşik Üst-Alt (Parent-Child) Parçalama: Hassas vektör araması için küçük alt parçalar (128 token) indekslenir; getirme anında üst bölüm (1024 token) LLM bağlamına yüklenir.
  3. Önermesel (Propositional) Parçalama: Paragrafları embedding öncesinde bağımsız, atomik olgusal önermelere ayrıştırır.