?
К достоверным исследованиям: разработка и профильная экспертная верификация корпуса утверждений о здоровье
Статья посвящена разработке и многоэтапной верификации специализированного корпуса текстовых утверждений о здоровье на русском языке. Актуальность исследования обусловлена высокой распространенностью медицинской дезинформации в Рунете и дефицитом качественно размеченных ресурсов, верифицированных профильными экспертами. Новизна работы заключается в комплексной междисциплинарной методологии создания корпуса, интегрирующей лингвистический анализ для обеспечения однозначности формулировок и строгую многоуровневую врачебную экспертизу с обязательной опорой на авторитетные источники. Методология включала отбор репрезентативных утверждений по пяти актуальным темам, их балансировку по осям «истинность/ложность» и «позитивная/негативная валентность», лингвистическое пилотирование на ясность и однозначность, а также независимую верификацию шестью врачами и тремя экспертами- медиками с последующим мета-ревью профильным специалистом. Особое внимание уделялось анализу стратегий верификации, используемых экспертами, и оценке их согласованности.
Результаты показали, что среди медицинских специалистов наблюдается значительный разброс мнений при оценке утверждений без обращения к источникам. Многоэтапный процесс верификации с привлечением мета- ревьюера оказался критически важным для достижения консенсуса по спорным утверждениям. Анализ выявил умеренную согласованность оценок врачей, основанных только на знаниях (каппа Флейсса = 0.316), и более высокую согласованность экспертов, работавших с источниками (каппа Флейсса = 0.383), что подтверждает необходимость обязательной эталонной проверки.
Ключевым результатом является создание сбалансированного корпуса из 108 верифицированных утверждений (40 истинных, 40 ложных, 28 спорных). Полученный датасет представляет собой ценный ресурс для few-shot обучения NLP-моделей, анализа стратегий верификации экспертами, а также для междисциплинарных исследований в области компьютерной лингвистики и когнитивных наук. Важной особенностью методологии стала разработка четких критериев для категоризации утверждений, включая категорию «спорно» для случаев частичной истинности, преувеличений и недостатка данных. Полученный датасет открывает новые возможности для разработки интеллектуальных систем, способных воспроизводить процесс проверки медицинских утверждений, включая формирование поисковых запросов, оценку достоверности источников и построение аргументированных заключений.