• Home
  • News
  • Blog
  • Releases
  • LLM history
  • Compare LLMs
  • Library
  • About
⌘K
Sign in

A blog and notes on development. The easiest way to reach me is via the social links below.

Contacts
talalaev.misha@gmail.com
Documents
Personal data processing policyPersonal data processing consent
Photo: majed swan / Unsplash

A medical LLM can doubt itself — just not where it is dangerous

Sh0ny
Sh0ny
18 августа 2026
  1. Home
  2. Blog
  3. A medical LLM can doubt itself — just not where it is dangerous
1 min read

In short

The study shows that a medical model's confidence really does respond to data quality, but in ambiguous cases it can stay too high. That matters more than overall accuracy: those are exactly the errors hardest to spot.

Главная проблема медицинского LLM — не только ошибочный диагноз, а уверенный ошибочный диагноз. В пилотном исследовании gpt-4.1-nano в среднем хорошо различал два похожих состояния, но особенно плохо справлялся с противоречивыми случаями, где цена самоуверенности выше всего.

Исследователи проверяли, меняется ли уверенность модели вместе с качеством доказательств. Для этого подготовили 45 синтетических клинических описаний: в них варьировали силу свидетельств, наличие конфликтующих признаков и пропуски информации. С тремя вариантами промптов получилось 135 испытаний.

Результат выглядит обнадёживающе — и одновременно тревожно. Точность в заданиях с принудительным выбором составила 93,5%, средняя уверенность — 78,4%. Уверенность снижалась, когда данных не хватало, и в целом была выше в правильных ответах, чем в неправильных. То есть она не оказалась случайным числом, никак не связанным с реальностью.

Но на уровне отдельных типов задач проявился неприятный сбой. В умеренно выраженных и противоречивых случаях вероятного AT-NCD модель чаще смещалась к диагнозу DRCI и сохраняла уверенность, которой фактическая точность не оправдывала. Высокий средний результат здесь мало утешает: врачу важнее знать, в каком именно классе ситуаций система начинает ошибаться.

Ограничения исследования существенные. Это пилотный прогон одной модели на синтетических виньетках и узком различении двух состояний, а не проверка на реальных пациентах. Работа показывает частичную чувствительность уверенности к доказательствам, но не доказывает клиническую готовность модели. Авторы также отдельно подчёркивают: качество уверенности нужно измерять напрямую, а не выводить из общей точности или возможностей модели.

Практический вывод простой: для медицинского AI недостаточно спрашивать, сколько ответов правильные. Нужно заранее искать локальные зоны переуверенности — особенно там, где признаки конфликтуют и данных не хватает. Иначе красивый процент точности будет скрывать именно те ошибки, которые труднее всего перепроверить.

Если бы вы внедряли такую систему в клинический процесс, доверили бы ей сначала простые случаи или именно пограничные, где она должна уметь честно сомневаться? Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
More AI-tool write-ups on the Telegram channel — short and to the point
Subscribe on Telegram

Comments

(0)
​