In short
The study shows that a medical model's confidence really does respond to data quality, but in ambiguous cases it can stay too high. That matters more than overall accuracy: those are exactly the errors hardest to spot.
Главная проблема медицинского LLM — не только ошибочный диагноз, а уверенный ошибочный диагноз. В пилотном исследовании gpt-4.1-nano в среднем хорошо различал два похожих состояния, но особенно плохо справлялся с противоречивыми случаями, где цена самоуверенности выше всего.
Исследователи проверяли, меняется ли уверенность модели вместе с качеством доказательств. Для этого подготовили 45 синтетических клинических описаний: в них варьировали силу свидетельств, наличие конфликтующих признаков и пропуски информации. С тремя вариантами промптов получилось 135 испытаний.
Результат выглядит обнадёживающе — и одновременно тревожно. Точность в заданиях с принудительным выбором составила 93,5%, средняя уверенность — 78,4%. Уверенность снижалась, когда данных не хватало, и в целом была выше в правильных ответах, чем в неправильных. То есть она не оказалась случайным числом, никак не связанным с реальностью.
Но на уровне отдельных типов задач проявился неприятный сбой. В умеренно выраженных и противоречивых случаях вероятного AT-NCD модель чаще смещалась к диагнозу DRCI и сохраняла уверенность, которой фактическая точность не оправдывала. Высокий средний результат здесь мало утешает: врачу важнее знать, в каком именно классе ситуаций система начинает ошибаться.
Ограничения исследования существенные. Это пилотный прогон одной модели на синтетических виньетках и узком различении двух состояний, а не проверка на реальных пациентах. Работа показывает частичную чувствительность уверенности к доказательствам, но не доказывает клиническую готовность модели. Авторы также отдельно подчёркивают: качество уверенности нужно измерять напрямую, а не выводить из общей точности или возможностей модели.
Практический вывод простой: для медицинского AI недостаточно спрашивать, сколько ответов правильные. Нужно заранее искать локальные зоны переуверенности — особенно там, где признаки конфликтуют и данных не хватает. Иначе красивый процент точности будет скрывать именно те ошибки, которые труднее всего перепроверить.
Если бы вы внедряли такую систему в клинический процесс, доверили бы ей сначала простые случаи или именно пограничные, где она должна уметь честно сомневаться? Источник: cs.AI updates on arXiv.org