APPLICATION OF RULE-BASED METHOD FOR AUTOMATIC EXTRACTION OF TAGS FROM COLUMN-STYLE PDF-DOCUMENTS
DOI:
https://doi.org/10.26577/jpcsit2025336Ключевые слова:
PDF parsing, Rule-based extraction, Metadata extraction, Document structure recognition, Text mining, Low-resource language processing, Knowledge base for LLMsАннотация
В данном исследовании представлен гибридный пайплайн на основе правил (rule-based) для автоматического извлечения структурированных метаданных из PDF-версий казахскоязычных газетных статей, с фокусом на национальной газете «Egemen Qazaqstan». Основная цель — поддержка разработки машиночитаемой базы знаний для последующего обучения больших языковых моделей (LLM) и создания ИИ-ассистента для задач дата-журналистики в Казахстане. Предложенный пайплайн интегрирует три open-source библиотеки — pdfminer.six, PyMuPDF и pdfplumber — для извлечения ключевых элементов: заголовка, автора, даты, аннотации, основного текста, названия издания и категории. Для оценки качества извлечения мы сравнили результаты автоматического парсинга с вручную размеченными эталонными файлами на основе трёх реальных выпусков газеты. Оценка проводилась по трём дополняющим друг друга метрикам: Precision, Textual Semantic Similarity (TSS) и Holistic Precision, которые позволяют учитывать как точные, так и семантически близкие совпадения. Результаты эксперимента показывают, что большинство тегов — особенно формализованные поля, такие как дата, название издания и категория — достигли идеального значения Holistic Precision (1.00), в то время как более вариативные поля, такие как заголовок, также показали высокий результат (более 0.85). После валидации пайплайн был масштабирован на полный корпус из 2 140 PDF-документов газеты за период с 2017 по март 2025 года, в результате чего было успешно конвертировано 159 135 статей в структурированный формат JSON. Полученный корпус представляет собой фундаментальную базу знаний для казахскоязычных ИИ-систем в области журналистики и медиа-аналитики.





