?
РАСПОЗНАВАНИЕ РУКОПИСНЫХ ГРАФИЧЕСКИХ ЭЛЕМЕНТОВ И МУЛЬТИЯЗЫЧНОГО ТЕКСТА: ОБЗОР СОВРЕМЕННЫХ ПОДХОДОВ, БАЗОВЫЙ МЕТОД И ПЕРСПЕКТИВЫ РАЗВИТИЯ
В данной статье представлен обзор современных методов решения задачи распознавания рукописного контента, включающего мультиязычный текст (русский и английский) и графические элементы, такие как блок-схемы из прямоугольников и стрелок, с акцентом на распознавание изображений маркерных досок. Для мультиязычного рукописного текста рассмотрены архитектуры, способные обрабатывать несколько языков, а для блок-схем - методы распознавания фигур и структуры. Кроме того, в работе предложена базовая модель, в которой для распознавания текста используются решения EasyOCR и TrOCR, а для анализа графических элементов - алгоритмы на базе OpenCV, выделяющие контуры фигур. Цель этой модели - оценить сложность решения поставленной задачи с использованием общедоступных инструментов при минимальной подготовке. Базовая модель ориентирована на специфическую задачу распознавания контента на маркерной доске, а результаты формируются в формате XML для последующей обработки, например визуализации. Система протестирована на специально собранном датасете изображений маркерных досок. В статье также обсуждаются основные сложности задачи распознавания и обозначаются перспективные направления для повышения точности и качества решения.