Стабильность ответов помогла определить, каким диагнозам медицинского ИИ можно доверять

ии диагнозИсследователи из Технического университета Дрездена и Университетской больницы Дрездена разработали медицинскую систему искусственного интеллекта, способную работать непосредственно на оборудовании больницы. Такой подход позволяет не передавать конфиденциальные сведения о пациентах внешним сервисам, а также помогает врачам оценивать надёжность предложенного ИИ диагноза.

Особое внимание учёные уделили вопросу, который становится всё более важным по мере развития медицинских нейросетей: как понять, когда ответ искусственного интеллекта заслуживает доверия? Эксперименты показали, что наиболее информативным признаком оказалась стабильность решения. Если система при повторном анализе одного и того же случая несколько раз называла одинаковый диагноз, вероятность правильного ответа была выше.

Результаты исследования опубликованы в журнале Nature Medicine.

Врач и пациент в виртуальном кабинете

Система основана на медицинском ИИ-агенте MIRA и работает в моделируемой клинической среде. В ней взаимодействуют два искусственных агента: один играет роль врача, а второй — пациента.

ИИ-врач может задавать уточняющие вопросы, изучать историю болезни и запрашивать результаты лабораторных анализов, физического обследования, микробиологических исследований и радиологических заключений. После сбора необходимой информации он формулирует основной диагноз и объясняет, на каких данных основано его решение.

ИИ-пациент получает сведения из конкретной медицинской записи и должен отвечать только в пределах имеющейся информации, не придумывая дополнительных симптомов или результатов обследований.

Для испытаний использовались обезличенные ретроспективные данные пациентов. Клинические случаи включали аппендицит, холецистит, дивертикулит, панкреатит, пневмонию, тромбоэмболию лёгочной артерии и инфекции мочевыводящих путей.

Точность приблизилась к облачной модели

На основном наборе из 551 случая лучшая локально работающая модель правильно определила заболевание приблизительно в 90% наблюдений. В другом тесте, включавшем четыре острых заболевания органов брюшной полости, точность составила около 84%.

Результат локальной модели на основном испытании оказался всего на 0,7 процентного пункта ниже показателя облачной системы. Это важно, поскольку локальная обработка позволяет медицинскому учреждению самостоятельно контролировать хранение данных, используемые версии моделей, права доступа и мониторинг работы системы.

Для дополнительной проверки специалисты изучили 181 случай. Совпадение между автоматической оценкой правильности диагнозов и общим мнением врачей составило 92,3%. При этом в некоторых ситуациях врачи признавали ответ ИИ клинически обоснованным, даже если он отличался от диагноза, указанного в электронной карте.

Повторяемость оказалась важнее уверенности модели

Учёные сравнили несколько способов оценки надёжности решений. Среди них были внутренние показатели вероятности, формулировки, выражающие уверенность, особенности объяснения и стабильность диагноза при повторных запусках.

Наиболее полезным сигналом оказалась именно повторяемость результата. Если при многократном анализе одного случая ИИ продолжал приходить к одинаковому выводу, диагноз с большей вероятностью был правильным.

При этом внутренние вероятностные показатели модели оказались менее надёжными. Во время стресс-теста исследователи ухудшали качество информации, доступной виртуальному врачу. Точность диагностики заметно снижалась, но собственные сигналы уверенности ИИ не всегда отражали возросший риск ошибки.

Стабильность ответа сама по себе не гарантирует правильность: система теоретически может несколько раз повторить одну и ту же ошибку. Однако в рамках проведённого исследования этот показатель лучше других проверенных характеристик отличал более надёжные решения от сомнительных.

ИИ с избирательной автономией

Авторы предлагают использовать принцип «избирательной автономии». Система могла бы самостоятельно обрабатывать случаи с устойчивыми и хорошо обоснованными результатами, а неоднозначные решения автоматически направлять врачу для дополнительной проверки.

Такой подход не предполагает полной замены специалиста. ИИ должен помогать собирать информацию, предлагать вероятный диагноз и предупреждать о неуверенности, но окончательная ответственность за диагностику и лечение остаётся за человеком.

Перед внедрением технологии в больницах необходимо провести дополнительные испытания. Исследование выполнялось в имитационной среде на ранее собранных данных, а не во время реального приёма пациентов. Учёные также обнаружили признаки более низкой точности в случаях, связанных с пожилыми людьми. Причины этого различия ещё предстоит выяснить.

Другой проблемой остаются вычислительные затраты: чтобы оценить стабильность диагноза, системе приходится анализировать один случай несколько раз. Команда намерена уменьшить необходимое количество повторных запусков и проверить работу ИИ с участием врачей, на более широком наборе заболеваний и в условиях, максимально приближенных к клинической практике.

Исследование показывает, что медицинскому ИИ недостаточно просто выдавать точные ответы в стандартных тестах. Для безопасного применения система должна защищать данные пациентов, объяснять свои выводы и ясно показывать врачу, когда её решению нельзя доверять без дополнительной проверки.

 
Статья прочитана 19 раз(a).
 

Еще из этой рубрики: