Комментировать

Ученые университета ИТМО создали библиотеку для обработки данных, чтобы точнее анализировать и извлекать иерархическую структуру документов

Программа определяет расположение элементов в PDF-файле с точностью до 98%, что позволит сделать документы машиночитаемыми и использовать их для создания эффективных систем поиска или чатов-ассистентов в крупных компаниях, сообщили в пресс-службе вуза.

Для обработки большого объема корпоративных документов нужно точно распознавать текст и его структуру. Обычно для этого используют алгоритмы автоматизации — это программное обеспечение, которое считывает текст и идентифицирует его отдельные элементы: заголовки, абзацы и другие. Однако у существующих инструментов в этой сфере есть недостатки: например, одни не умеют определять структуру текста, а другие плохо работают с объемными документами и «теряются» в контексте и структуре. Кроме того, существует риск утечки конфиденциальных данных при работе с открытыми сервисами.

Разработчики ИТМО создали инструмент, компенсирующий недостатки известных решений. Они разработали библиотеку для обработки данных DocuMentor, которая позволяет с высокой точностью распознавать и извлекать иерархическую структуру документов, идентифицируя различные элементы внутри: заголовки, таблицы, изображения, формулы. Сервис работает с наиболее распространенными форматами документов: PDF, DOCX и языком разметки для форматирования текстовых документов Markdown. В дальнейшем авторы планируют «научить» программу обрабатывать и другие форматы документов.

Исследование показало, что DocuMentor совершает ошибки при распознавании символов в 1,3% случаев, а при распознавании слов — в 2,5%. Это примерно в 6-10 раз меньше ошибок при анализе текстов и в 2-6 раз меньше ошибок при анализе сканов PDF-файлов по сравнению с аналогами. Также DocuMentor с высокой точностью определяет расположение элементов в PDF-файлах — около 98% для обычных текстовых PDF и 94% для сканов. Сервис можно интегрировать в любые продукты для распознавания и анализа структуры документов. Уже сейчас DocuMentor использует компания Минстрой России в проекте, связанном с построением базы данных на основе нормативных документов.

Источник: ТАСС

#электронный документооборот #наука и техника
Комментировать

Комментарии

Комментировать

Вам может быть интересно

17
#цифровизация

В Главгосэкспертизе создали собственную языковую модель, которая ищет ошибки в документации

Об этом сообщил первый заместитель начальника Главгосэкспертизы России Вадим Андропов на секции «Цифровая трансформация строительства и жилищно-коммунального хозяйства» Совета по развитию цифровой экономики при Совете Федерации
33
#цифровизация

В НИУ «МЭИ» разработана интеллектуальная облачная система учета и контроля оборудования

Уникальность разработанной системы заключается в цифровом документообороте и передаче данных через облачную платформу между разными подразделениями