APPLICATION OF RULE-BASED METHOD FOR AUTOMATIC EXTRACTION OF TAGS FROM COLUMN-STYLE PDF-DOCUMENTS
DOI:
https://doi.org/10.26577/jpcsit2025336Ключові слова:
PDF parsing, Rule-based extraction, Metadata extraction, Document structure recognition, Text mining, Low-resource language processing, Knowledge base for LLMsАнотація
Бұл зерттеуде қазақ тіліндегі газет мақалаларының PDF-нұсқаларынан құрылымдалған метадеректерді автоматты түрде алу үшін ережеге негізделген (rule-based) гибридті пайплайн ұсынылады. Зерттеу негізінен ұлттық «Egemen Qazaqstan» газетіне бағытталған. Негізгі мақсат – болашақта үлкен тілдік модельдерді (LLM) оқыту және Қазақстанда деректер журналистикасы үшін ЖИ-негізделген көмекші құруға арналған машинамен оқылатын білім базасын әзірлеу. Ұсынылған пайплайн үш ашық бастапқы кітапхананы — pdfminer.six, PyMuPDF және pdfplumber — біріктіреді және оларды келесі негізгі элементтерді алу үшін қолданады: тақырып, автор, күні, аннотация, мәтін, басылым атауы және категория. Алу сапасын бағалау үшін автоматты түрде алынған нәтижелер нақты газет шығарылымдарынан қолмен таңбаланған эталондық файлдармен салыстырылды. Бағалау үш толықтырушы метриканы қолданды: Precision, Textual Semantic Similarity (TSS) және Holistic Precision, олар дәл сәйкестіктермен қатар мағыналық ұқсастықтарды да ескеруге мүмкіндік береді. Эксперимент нәтижелері тегтердің көбісі – әсіресе құрылымдалған өрістер (күн, басылым атауы, категория) – Holistic Precision бойынша мінсіз нәтижеге (1.00) жеткенін көрсетті, ал ауыспалы өрістер, мысалы тақырып, 0.85-тен жоғары көрсеткіш көрсетті. Тестілеу жүргізілгеннен кейін бұл пайплайн 2017 жылдан 2025 жылғы наурызға дейін жарияланған 2 140 газет PDF файлына қолданылып, 159 135 мақала JSON құрылымына сәтті түрлендірілді. Бұл толықтырылған корпус қазақ тілді ЖИ жүйелерін дамытуда, журналистика мен медиа-талдауда негіз бола алады.





