?
Экспертная оценка ответов больших генеративных моделей на запросы врачей в клинической практике
Использование больших генеративных моделей (БГМ) в здравоохранении в настоящее время вызывает значительный интерес. Проведено сравнение БГМ GigaChat и YandexGPT. Выборка 1200 ответов БГМ на запросы врачей из медицинских организаций, оказывающих помощь в амбулаторных и в стационарных условиях, по 7 тематикам оценивалась 13 врачами-экспертами по 5 пятибалльным критериям: релевантность, правильность, безопасность, полнота, языковая грамотность. Анализ выполнен с использованием парного t-критерия с оценкой размера эффекта. Наблюдались разнонаправленные различия между моделями в качестве ответов, в зависимости от критерия оценки и тематики запроса. Отмечено неудовлетворительное качество ответов по критериям безопасности и правильности по ряду тематик (GigaChat «Лекарственные средства» 3,1±1,5 правильность, 3,3±1,6 безопасность, YandexGPT «Параметры и нормы методов исследования» 3,3±1,5 для обоих критериев). Таким образом, БГМ в настоящее время не готовы выполнять функцию ассистента врача.