• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: majed swan / Unsplash

Медицинский LLM умеет сомневаться — но не там, где опасно

Sh0ny
Sh0ny
18 августа 2026
  1. Главная
  2. Блог
  3. Медицинский LLM умеет сомневаться — но не там, где опасно
1 мин чтения

Коротко

Исследование показывает: уверенность медицинской модели действительно реагирует на качество данных, но в неоднозначных случаях может оставаться слишком высокой. Это важнее общей точности — именно такие ошибки сложнее заметить.

Главная проблема медицинского LLM — не только ошибочный диагноз, а уверенный ошибочный диагноз. В пилотном исследовании gpt-4.1-nano в среднем хорошо различал два похожих состояния, но особенно плохо справлялся с противоречивыми случаями, где цена самоуверенности выше всего.

Исследователи проверяли, меняется ли уверенность модели вместе с качеством доказательств. Для этого подготовили 45 синтетических клинических описаний: в них варьировали силу свидетельств, наличие конфликтующих признаков и пропуски информации. С тремя вариантами промптов получилось 135 испытаний.

Результат выглядит обнадёживающе — и одновременно тревожно. Точность в заданиях с принудительным выбором составила 93,5%, средняя уверенность — 78,4%. Уверенность снижалась, когда данных не хватало, и в целом была выше в правильных ответах, чем в неправильных. То есть она не оказалась случайным числом, никак не связанным с реальностью.

Но на уровне отдельных типов задач проявился неприятный сбой. В умеренно выраженных и противоречивых случаях вероятного AT-NCD модель чаще смещалась к диагнозу DRCI и сохраняла уверенность, которой фактическая точность не оправдывала. Высокий средний результат здесь мало утешает: врачу важнее знать, в каком именно классе ситуаций система начинает ошибаться.

Ограничения исследования существенные. Это пилотный прогон одной модели на синтетических виньетках и узком различении двух состояний, а не проверка на реальных пациентах. Работа показывает частичную чувствительность уверенности к доказательствам, но не доказывает клиническую готовность модели. Авторы также отдельно подчёркивают: качество уверенности нужно измерять напрямую, а не выводить из общей точности или возможностей модели.

Практический вывод простой: для медицинского AI недостаточно спрашивать, сколько ответов правильные. Нужно заранее искать локальные зоны переуверенности — особенно там, где признаки конфликтуют и данных не хватает. Иначе красивый процент точности будет скрывать именно те ошибки, которые труднее всего перепроверить.

Если бы вы внедряли такую систему в клинический процесс, доверили бы ей сначала простые случаи или именно пограничные, где она должна уметь честно сомневаться? Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​