Yapılandırılmamış Kurumsal Dokümanların Veri Madenciliği ve Büyük Dil Modelleri ile Sorgulanabilir Bilgi Tabanlarına Dönüştürülmesi


Creative Commons License

Sarıtaş A., KAYA İ., GUNAL E. S.

Nicel bilimler dergisi (Online), cilt.8, sa.1, ss.100-117, 2026 (TRDizin)

Özet

Fatura ve stok raporları gibi yapılandırılmamış kurumsal dokümanlar, otomatik veri çıkarımı ve analizi açısından önemli zorluklar barındırmaktadır. Bu çalışma, metin tabanlı PDF dokümanlarını optik karakter tanıma (OCR) işlemine gerek kalmadan, alana özgü düzenli ifadeler (regex) ve veri madenciliği teknikleri kullanarak yüksek oranda yapılandırılmış CSV veri setlerine dönüştüren uçtan uca bir çerçeve önermektedir. Çıkarılan verilerin analitik tutarlılığını doğrulamak amacıyla tanımlayıcı istatistiksel analizler, öznitelik mühendisliği ve müşteri segmentasyonu işlemleri gerçekleştirilmiştir. Ardından, üretilen bu yapılandırılmış veri setleri, doğal dil sorgulama performanslarını değerlendirmek üzere GPT-5, Gemini 2.5, Grok 4, Qwen3-Max ve DeepSeek-V3.1 olmak üzere, beş farklı büyük dil modeli (LLM) için bilgi tabanı olarak kullanılmıştır. Somut soru-cevap senaryolarına dayalı karşılaştırmalı analizler, iyi yapılandırılmış verilerin LLM doğruluğunu önemli ölçüde artırdığını; ancak genel performansın modellerin bağlam uzunluğu sınırları ve çoklu satır ilişkilendirme yetenekleriyle güçlü bir şekilde kısıtlandığını göstermiştir. En yüksek başarı oranlarına GPT-5 ve Gemini 2.5 ulaşmıştır. Sonuç olarak elde edilen bulgular, geleneksel veri madenciliği tekniklerinin üretken yapay zekâ ile birleştirilmesinin, yapılandırılmamış kurumsal dokümanları sorgulanabilir karar destek sistemlerine dönüştürmek için son derece güvenilir bir yaklaşım sunduğunu kanıtlamaktadır.
Unstructured corporate documents, such as invoices and inventory reports, pose significant challenges for automated data extraction and analysis. This study proposes an end-to-end framework that transforms text-based PDF documents into highly structured CSV datasets using domain-specific regular expressions (regex) and data mining techniques, bypassing the need for optical character recognition (OCR). To validate the analytical consistency of the extracted data, descriptive statistical analyses, feature engineering, and customer segmentation were performed. Subsequently, the structured datasets were utilized as knowledge bases for five distinct large language models (LLMs), including GPT-5, Gemini 2.5, Grok 4, Qwen3-Max, and DeepSeek-V3.1 to evaluate their natural language query performance. A comparative analysis based on concrete question-answering scenarios revealed that while well-structured data significantly enhances LLM accuracy, overall performance is heavily constrained by the models' context length limits and multi-row reasoning capabilities. GPT-5 and Gemini 2.5 achieved the highest success rates. Ultimately, the findings demonstrate that coupling traditional data mining techniques with generative AI provides a highly reliable approach for transforming unstructured corporate documents into queryable decision-support systems.