Автоматизация процессов извлечения данных из таблиц электронных документов неструктурированного формата: методы и инструментальные средства

А. О. Шигаров

Аннотация


Представлен обзор исследований по созданию методов автоматизированного понимания таблиц (АПТ) и комплекса инструментальных средств на их основе для упрощения разработки прикладного программного обеспечения извлечения данных из документных таблиц с машиночитаемым текстовым содержимым, представленных в неструктурированном виде, за счет поддержки произвольности табличной структуры. Решены следующие задачи: проанализирована совокупность задач АПТ и усовершенствована ее структура; выявлены ограничения текущего исследования вопросов АПТ и сформулированы актуальные направления его развития; предложен метод автоматизации распознавания таблиц в НПОД, т. е. конвертирования их в редактируемый формат РК; предложен метод автоматизации анализа и интерпретации таблиц РК, т. е. извлечения из них наборов записей в канонической форме; разработаны инструментальные средства на основе предлагаемых методов; выполнена оценка производительности реализованных решений и сравнение их с аналогами; изучены возможности практической применимости предлагаемых методов и инструментальных средств. Методы исследования основаны на применении эвристик, машинного обучения, систем исполнения правил, моделей данных, формальных грамматик, трансляции программ и тестов производительности.

Ключевые слова


Электронные документы; неструктурированные форматы; документные таблицы; автоматизированное понимание таблиц; PDF; PostScript; Excel; Sheets.

Полный текст:

PDF

Литература


T. Adams, et al. (2021). Benchmarking table recognition performance on biomedical literature on neurological disorders. Bioinformatics. 10.1093/bioinformatics/btab843.

M. Göbel, et al. (2012). A methodology for evaluating algorithms for table understanding in PDF documents. Proc. ACM DocEng. 10.1145/2361354.2361365.

M. Hurst (2000). The interpretation of tables in texts: Ph.D. thesis / Univ. of Edinburgh. http://hdl.handle.net/1842/7309.

Kieninger T. (1998). Table structure recognition based on robust block segmentation. Doc. Recognition V.

Shigarov A., Fedorov R. Simple algorithm page layout analysis // Pattern Recognition and Image Analysis. 2011. 21(2), 324–327. 10.1134/S1054661811021008. RHIMIH.

Shigarov A. Table understanding using a rule engine // Expert Systems with Applications. 2015. 42(2), 929–937. 10.1016/j.eswa.2014.08.045. UEGHLB.

Shigarov A., Mikhailov A. Rule-based spreadsheet data transformation from arbitrary to relational tables // Information Systems. 2017. 71, 123–136. 10.1016/j.is.2017.08.004. XNTUCT.

Shigarov A., Khristyuk V., Mikhailov A. TabbyXL: Software platform for rule-based spreadsheet data extraction and transformation // SoftwareX. 2019. 10, 100270. 10.1016/j.softx.2019.100270. VIEIBF.

Shigarov A. Table understanding: problem overview // WIREs Data Mining and Knowledge Discovery. 2023. 13(1), e1482. 10.1002/widm.1482. DVFJBC.

X. Wang (1996). Tabular abstraction, editing, and formatting: Ph.D. thesis / Univ. of Waterloo.

X. Wu, et al. (2023). HUSS: A heuristic method for understanding the semantic structure of spreadsheets. Data Intelligence. 10.1162/dint_a_00201.

J. Yepes, et al. (2021). ICDAR 2021 Competition on scientific literature parsing. Proc. 16th ICDAR 2021. 10.48550/arXiv.2106.14616.

Yurin A., Dorodnykh N., Shigarov A. Semi-automated formalization and representation of the engineering knowledge extracted from spreadsheet data // IEEE Access. 2021. 9, 157468–157481. 10.1109/ACCESS.2021.3130172. ZFRJUM.

Шигаров А. О., Бычков И. В. и др. Система трансформации таблиц // Информационные технологии и вычислительные системы. 2013. № 3. С. 15–26. RCDLGP.

Шигаров А. О. Восстановление логической структуры таблиц из неструктурированных текстов на основе логического вывода // Вычислительные технологии. 2014. Т. 19, № 1. С. 87–99. RYYHBV.

Шигаров А. О., Бычков И. В. и др. Анализ и интерпретация произвольных таблиц на основе исполнения CRL-правил // Вычислительные технологии. 2015. Т. 20, № 6. С. 87–112. VKAMER.

Шигаров А. О., Парамонов В.В. Сегментация текста неразмеченных PDF-документов // Вычислительные технологии. 2022. Т. 27, № 5. С. 69–78. 10.25743/ICT.2022.27.5.007. DAOWQG.

Шигаров А. О. Распознавание таблиц неаннотированных PDF-документов на основе использования PDF-специфичных свойств // Выч. технологии. 2024. Т. 29, № 6. С. 125–146. 10.25743/ICT.2024.29.6.008. CVSWTN.

Шигаров А. О. Извлечение реляционных данных из произвольных таблиц электронных документов редактируемых форматов на основе пользовательских правил // Вычислительные технологии. 2025. Т. 30, № 3. С. 127–144. 10.25743/ICT.2025.30.3.010. XFYDSE.




DOI: https://doi.org/10.54708/SIIT-2026-no4-p12

Ссылки

  • На текущий момент ссылки отсутствуют.


(c) 2026 А. О. Шигаров