Что происходит, если медицинский искусственный интеллект уверенно выдает неправильный диагноз? Исследователи из Технического университета Дрездена предложили необычно простой способ оценить надежность ответа: несколько раз задать системе один и тот же вопрос.
Исследование, опубликованное в Nature Medicine в сентябре 2026 года, показало, что стабильность ответов может быть полезным признаком. Если ИИ при повторных запусках приходит к разным выводам, такой случай может требовать особенно внимательной проверки врачом.
<h3>Как ученые проверяли медицинский ИИ</h3>
Исследовательская группа разработала систему искусственного интеллекта, способную полностью работать внутри инфраструктуры медицинского учреждения. Такой подход позволяет хранить конфиденциальные данные пациентов локально и не передавать их внешним сервисам.
Для проверки системы ученые создали виртуальные медицинские консультации с участием двух ИИ-агентов.
Один выполнял роль врача: задавал вопросы, уточнял симптомы и назначал обследования. Второй имитировал пациента, используя обезличенные медицинские данные.
Среди рассматриваемых состояний были аппендицит, пневмония, тромбоэмболия легочной артерии и инфекции мочевыводящих путей.
Лучшие локально работающие модели достигли точности 90,04% в тесте с семью заболеваниями и 83,8% в отдельной проверке с четырьмя заболеваниями.
Врачи дополнительно изучили 181 выбранный случай. Их общее заключение совпало с автоматической оценкой в 92,3% случаев.
<h3>Почему один ответ оказался недостаточным</h3>
Высокая средняя точность системы еще не означает, что конкретный диагноз будет правильным. Поэтому ученые отдельно изучили 551 клинический случай и попытались определить, какие показатели лучше всего помогают выявлять надежные ответы.
Они сравнили внутренние оценки вероятности, уверенность, выраженную ИИ в текстовых объяснениях, и стабильность диагноза при пяти независимых запусках одного и того же случая.
Именно повторяемость результата оказалась наиболее информативным показателем правильности.
Для оценки использовался статистический показатель AUC, который отражает способность метода различать правильные и неправильные результаты. Для диагностической стабильности он достиг 0,860.
Когда исследователи отбирали только случаи с показателем согласованности не менее 0,90, точность системы повышалась до 98,9%.
Однако этому условию соответствовали лишь 49,4% случаев. Это означает, что примерно половина результатов все равно требовала дополнительной проверки.
<h3>Уверенность ИИ может вводить в заблуждение</h3>
Особенно интересные результаты получили, когда ученые намеренно убрали часть надежной клинической информации.
Точность диагностики снизилась с 90,6% до 70,2%. При этом внутренние показатели уверенности модели в некоторых случаях оставались высокими. Другими словами, система могла ошибаться, но при этом выглядеть весьма убедительно.
Стабильность ответов реагировала на ухудшение качества информации иначе: она снижалась и продолжала помогать отличать правильные диагнозы от ошибочных.
Это показывает, почему уверенный тон ИИ нельзя автоматически воспринимать как доказательство точности медицинского заключения.
<h3>Как может измениться роль врача</h3>
Авторы предлагают использовать стабильность ответов для так называемой выборочной автономности. В такой системе искусственный интеллект мог бы самостоятельно обрабатывать только те случаи, в которых результаты выглядят достаточно надежными. Более сомнительные ситуации автоматически передавались бы врачу для дополнительной оценки.
Старший исследователь Якоб Николас Катер подчеркнул, что цель технологии заключается не в замене медицинских специалистов, а в их поддержке.
Если система способна показывать собственную неопределенность, врачу проще понять, где автоматическому выводу можно уделить меньше внимания, а где требуется особенно тщательная проверка.
Работа ИИ непосредственно внутри больничной инфраструктуры также может помочь медицинским организациям лучше контролировать доступ к данным пациентов и использование системы.
<h3>Метод пока не дает полной гарантии</h3>
Стабильность ответа не означает, что диагноз обязательно верен. В некоторых случаях система несколько раз подряд давала один и тот же ошибочный результат.
Кроме того, точность оказалась ниже в смоделированных случаях с пожилыми пациентами.
Есть и другие ограничения. Исследование проводилось на ретроспективных симуляциях, а не в обычной клинической практике. Многократный запуск одного случая также требует больше вычислительных ресурсов.
Порог надежности, подходящий для одной ИИ-модели, может оказаться непригодным для другой.
Поэтому необходимы дополнительные клинические исследования, прежде чем такой подход можно будет широко применять в медицине.
Тем не менее работа предлагает важную идею: медицинский ИИ должен не только искать правильный диагноз, но и помогать врачу понимать, когда собственному ответу системы стоит доверять меньше и требуется дополнительное мнение.