Kanonik Mühendislik Kılavuzu #02|TinyCTO RAG Bible
Doküman Alımı ve Düzen Ayrıştırma
Düzen duyarlı görsel doküman ayrıştırma, OCR hata toleransı, tablo yapısı kurtarma ve parçalama kuralları.
Kanonik Onaylı 12 min
#1. Fiziksel Doküman Ayrıştırma Zorlukları
Basit metin çıkarma araçları (örneğin temel PyPDF), çok sütunlu metinleri yatay satırlar halinde birleştirerek ve karmaşık tablo ilişkilerini bozarak doküman yapısına zarar verir. Kurumsal RAG sistemleri, yapısal hiyerarşiyi koruyan düzen duyarlı (layout-aware) ayrıştırıcılar gerektirir.
Düzen Duyarlı Bölümleme
- Görsel Destekli Ayrıştırıcılar: Docling veya Marker gibi sistemler, dokümanları anlamsal sınırlayıcı kutulara (başlıklar, paragraflar, tablolar) ayırmak için hafif görsel modeller kullanır.
- Tablo Yapısının Korunması: Tablo verileri, açık başlık-hücre bağlamlarıyla temiz Markdown veya HTML tablo yapılarına dönüştürülmelidir.
- Okuma Sırasının Yeniden Oluşturulması: Çok sütunlu düzenler, sayfa sınırı boyunca soldan sağa okunmak yerine sütun bazında dikey olarak ayrıştırılmalıdır.
#2. Parçalama (Chunking) Mimarileri ve Değişmezleri
- Örtüşmeli Sabit Boyutlu Parçalama: Standart taban çizgisi (512 token boyut, 64 token örtüşme). Uygulaması kolaydır ancak cümle sınırlarını bölebilir.
- Hiyerarşik Üst-Alt (Parent-Child) Parçalama: Hassas vektör araması için küçük alt parçalar (128 token) indekslenir; getirme anında üst bölüm (1024 token) LLM bağlamına yüklenir.
- Önermesel (Propositional) Parçalama: Paragrafları embedding öncesinde bağımsız, atomik olgusal önermelere ayrıştırır.
