• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Andrea De Santis / Unsplash

LLM проходят медлицензии, но не могут безопасно сортировать пациентов

Sh0ny
Sh0ny
4 августа 2026
  1. Главная
  2. Блог
  3. LLM проходят медлицензии, но не могут безопасно сортировать пациентов
2 мин чтения

Коротко

Проблема не в знаниях, а в архитектурной слепоте: модель, оптимизированная на наиболее вероятное продолжение текста, систематически пропускает редкие, но катастрофические диагнозы. Разбор аргументации из arXiv.

LLM уже сдают медицинские лицензионные экзамены и в отдельных случаях соперничают с врачами в диагностическом рассуждении. Но авторы новой статьи на arXiv утверждают: для автономного триаджа пациентов — когда человек обращается сам, без клинициста в контуре — доказательств безопасности не существует. И дело не в том, что модель мало знает медицину. Дело в том, как она принимает решения под неопределённостью.

Безопасный триадж — это не выбор наиболее вероятного диагноза. Это последовательное решение с асимметричной ценой ошибки: один катастрофический пропуск перевешивает множество ложных тревог, а решающий сигнал может быть тем, который пациент сам не сообщил и который модель не догадалась запросить. Модель, оптимизированная на продолжение наиболее вероятного текста, по определению не оптимизирована действовать безопасно, когда безопасный ответ — маловероятный диагноз категории must-not-miss.

Базовый дефицит — сбор информации в условиях неопределённости. При неполных историях болезни LLM не демонстрируют паттернов, которых требует безопасный триадж:

  • расширение дифференциального ряда;
  • поиск пропущенных красных флагов;
  • снижение порога эскалации;
  • откладывание суждения до получения достаточных данных;
  • рост уровня тревоги, когда высокорисковые диагнозы не исключены.

Что делает эту проблему особенно коварной — её трудно обнаружить в существующих бенчмарках. Оценки до сих пор часто строятся на полных, тщательно курируемых симуляциях с уже готовыми данными. В таких условиях модель не проваливается, потому что ей не нужно проявлять инициативу в сборе информации. В реальном триадже пациент даёт неполную картину, и именно способность задавать правильные дополнительные вопросы определяет безопасность.

Авторы также отмечают, что применение LLM в таких сценариях может усугубляться ассистентскими паттернами и позитивным смещением: доверчивостью, уступчивостью и плохой калибровкой уверенности — особенно когда эти свойства не ограничены внешней клинической логикой триаджа.

Практический вывод для разработчиков AI-агентов выходит за рамки медицины. Везде, где цена ложного отрицания выше цены ложного срабатывания, а критическая информация изначально неполна, чистая генерация наиболее вероятного ответа — недостаточная стратегия. Нужен внешний каркас, который заставляет агента расширять гипотезы, искать недостающие сигналы и эскалировать при неотключённых высокорисковых сценариях. Без него «умная» модель — это модель, которая уверенно пропускает именно то, что пропустить нельзя.

Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​