Что происходит, если медицинский искусственный интеллект уверенно выдает неправильный диагноз? Исследователи из Технического университета Дрездена предложили необычно простой способ оценить надежность ответа: несколько раз задать системе один и тот же вопрос.


Исследование, опубликованное в Nature Medicine в сентябре 2026 года, показало, что стабильность ответов может быть полезным признаком. Если ИИ при повторных запусках приходит к разным выводам, такой случай может требовать особенно внимательной проверки врачом.


<h3>Как ученые проверяли медицинский ИИ</h3>


Исследовательская группа разработала систему искусственного интеллекта, способную полностью работать внутри инфраструктуры медицинского учреждения. Такой подход позволяет хранить конфиденциальные данные пациентов локально и не передавать их внешним сервисам.


Для проверки системы ученые создали виртуальные медицинские консультации с участием двух ИИ-агентов.


Один выполнял роль врача: задавал вопросы, уточнял симптомы и назначал обследования. Второй имитировал пациента, используя обезличенные медицинские данные.


Среди рассматриваемых состояний были аппендицит, пневмония, тромбоэмболия легочной артерии и инфекции мочевыводящих путей.


Лучшие локально работающие модели достигли точности 90,04% в тесте с семью заболеваниями и 83,8% в отдельной проверке с четырьмя заболеваниями.


Врачи дополнительно изучили 181 выбранный случай. Их общее заключение совпало с автоматической оценкой в 92,3% случаев.


<h3>Почему один ответ оказался недостаточным</h3>


Высокая средняя точность системы еще не означает, что конкретный диагноз будет правильным. Поэтому ученые отдельно изучили 551 клинический случай и попытались определить, какие показатели лучше всего помогают выявлять надежные ответы.


Они сравнили внутренние оценки вероятности, уверенность, выраженную ИИ в текстовых объяснениях, и стабильность диагноза при пяти независимых запусках одного и того же случая.


Именно повторяемость результата оказалась наиболее информативным показателем правильности.


Для оценки использовался статистический показатель AUC, который отражает способность метода различать правильные и неправильные результаты. Для диагностической стабильности он достиг 0,860.


Когда исследователи отбирали только случаи с показателем согласованности не менее 0,90, точность системы повышалась до 98,9%.


Однако этому условию соответствовали лишь 49,4% случаев. Это означает, что примерно половина результатов все равно требовала дополнительной проверки.


<h3>Уверенность ИИ может вводить в заблуждение</h3>


Особенно интересные результаты получили, когда ученые намеренно убрали часть надежной клинической информации.


Точность диагностики снизилась с 90,6% до 70,2%. При этом внутренние показатели уверенности модели в некоторых случаях оставались высокими. Другими словами, система могла ошибаться, но при этом выглядеть весьма убедительно.


Стабильность ответов реагировала на ухудшение качества информации иначе: она снижалась и продолжала помогать отличать правильные диагнозы от ошибочных.


Это показывает, почему уверенный тон ИИ нельзя автоматически воспринимать как доказательство точности медицинского заключения.


<h3>Как может измениться роль врача</h3>


Авторы предлагают использовать стабильность ответов для так называемой выборочной автономности. В такой системе искусственный интеллект мог бы самостоятельно обрабатывать только те случаи, в которых результаты выглядят достаточно надежными. Более сомнительные ситуации автоматически передавались бы врачу для дополнительной оценки.


Старший исследователь Якоб Николас Катер подчеркнул, что цель технологии заключается не в замене медицинских специалистов, а в их поддержке.


Если система способна показывать собственную неопределенность, врачу проще понять, где автоматическому выводу можно уделить меньше внимания, а где требуется особенно тщательная проверка.


Работа ИИ непосредственно внутри больничной инфраструктуры также может помочь медицинским организациям лучше контролировать доступ к данным пациентов и использование системы.


<h3>Метод пока не дает полной гарантии</h3>


Стабильность ответа не означает, что диагноз обязательно верен. В некоторых случаях система несколько раз подряд давала один и тот же ошибочный результат.


Кроме того, точность оказалась ниже в смоделированных случаях с пожилыми пациентами.


Есть и другие ограничения. Исследование проводилось на ретроспективных симуляциях, а не в обычной клинической практике. Многократный запуск одного случая также требует больше вычислительных ресурсов.


Порог надежности, подходящий для одной ИИ-модели, может оказаться непригодным для другой.


Поэтому необходимы дополнительные клинические исследования, прежде чем такой подход можно будет широко применять в медицине.


Тем не менее работа предлагает важную идею: медицинский ИИ должен не только искать правильный диагноз, но и помогать врачу понимать, когда собственному ответу системы стоит доверять меньше и требуется дополнительное мнение.