?
Автоматизированное формирование журналов событий на основе неструктурированных Интернет-источников для задач анализа процессов
Заголовок: Автоматизированное формирование журналов событий на основе неструктурированных Интернет-источников для задач анализа процессов.
Аннотация: В статье представлен подход к автоматизированному структурированию информации о событиях, извлекаемой из неструктурированных текстовых Интернет-источников, для задач углублённого анализа процессов. Во многих практических случаях сведения о событиях, происходящих в рамках различных процессов, представлены не в виде готовых журналов событий, а распределены по новостным публикациям, отчётам и другим текстовым материалам. Это существенно усложняет применение средств анализа процессов, использующих данные, представленные в определённых форматах (например XES), поскольку требует выполнить поиск релевантных текстов, их интерпретацию и преобразование в структурированное представление, пригодное для анализа с помощью существующих средств Process Mining. Задача ещё более усложняется, если необходимо извлекать дополнительные атрибуты, связанные с описанными событиями, что даёт возможность выявить более глубокие закономерности, характеризующие исследуемые процессы, применять новые методы анализа процессов, учитывающие эти характеристики. Предлагаемый подход основан на сочетании онтологического представления знаний о предметных областях и источниках данных и больших языковых моделей, генеративного искусственного интеллекта. Онтологический слой используется для описания предметных областей исследуемых процессов, открытых источников информации о них, пользовательских запросов и результатов обработки найденной информации, тогда как генеративные модели обеспечивают поиск релевантной информации, извлечение данных о событиях и их первичную обработку и структурирование. Для реализации подхода предложена общая архитектура решения, позволяющего автоматизировать получение текстовых данных из различных источников на основе пользовательских запросов, сформированных с использованием онтологии, предобработку полученных данных с использованием генеративных моделей, структурирование и нормализацию извлечённых данных о событиях, а также подготовку данных для формирования журналов событий в заданных форматах. Для иллюстрации возможностей предложенного подхода рассматривается контролируемый экспериментальный сценарий. Проведённые эксперименты показали, что описанное программное решение позволяет находить релевантные текстовые материалы, выделять события и их атрибуты, а также формировать структурированное представление, пригодное для последующего преобразования в журнал событий. Вместе с тем результаты показали необходимость дополнительной нормализации данных и экспертной интерпретации части извлечённой информации.
Ключевые слова: поиск информации; обработка текстов на естественных языках; интеллектуальный анализ текстов; извлечение информации о событиях; протоколирование событий; подход, основанный на онтологии; подход на основе ИИ; генеративные модели; большая языковая модель; контроль и анализ процессов.
Для цитирования: Воронова К.Д., Лядова Л.Н. Автоматизированное формирование журналов событий
для задач анализа процессов на основе неструктурированных Интернет-источников. Труды ИСП РАН,
том 38, вып. 4, часть 1, 2026 г., стр. 153–170 (на английском языке). DOI: 10.15514/ISPRAS-2026-38(4)-8.