• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Javier Garcia Chavez / Unsplash

Умнее не значит справедливее: LLM сохраняют стереотипы в медицине

Sh0ny
Sh0ny
10 августа 2026
  1. Главная
  2. Блог
  3. Умнее не значит справедливее: LLM сохраняют стереотипы в медицине
1 мин чтения

Коротко

Новые reasoning-модели показывают сильные результаты в рассуждениях, но это не сделало их медицинские примеры более репрезентативными. Разбираю, почему рост качества модели не заменяет отдельную проверку на расовые и гендерные перекосы.

В медицине опасен не только неправильный диагноз от AI. Не менее неприятный сценарий — когда модель уверенно описывает пациента через расовый или гендерный стереотип, а врач принимает такой пример за нейтральный.

Исследователи Flinders University проверили два reasoning-LLM: o3-mini и DeepSeek-R1. Они сгенерировали 36 000 клинических описаний вымышленных пациентов и сравнили распределение расы и пола с ожидаемым представлением разных групп при распространённых заболеваниях.

Результат неприятный: способность лучше рассуждать сама по себе не добавила справедливости. Для o3-mini исследователи обнаружили значимое искажение в 78% случаев по расе и в 56% по полу. У DeepSeek-R1 — в 89% и 67% соответственно. Для сравнения, у GPT-4 в предыдущем анализе было по 67% для обоих показателей.

Особенно заметным оказался перекос в сторону Black populations при описании состояний вроде sarcoidosis, systemic lupus erythematosus, pre-eclampsia и essential hypertension. Модели также часто преувеличивали долю «большинствующего» пола. То есть AI не просто ошибается случайным образом — он может превращать статистические ассоциации из обучающих данных в шаблон пациента.

Практический вывод для тех, кто внедряет LLM в медицину: benchmark на рассуждение не отвечает на вопрос, насколько модель безопасна и репрезентативна. Нужны отдельные проверки распределения демографических признаков и постоянный мониторинг, особенно если результат модели попадает в клинический рабочий процесс.

Но у исследования есть важные границы. Проверялись только два reasoning-LLM и именно сгенерированные клинические виньетки, а не реальные решения врачей или исходы лечения. Авторы также не утверждают, что причина обязательно в сознательном «предубеждении» модели: она может выбирать прототипические, а не репрезентативные случаи из-за закономерностей в обучающих данных. Это всё равно проблема, но механизм и реальный ущерб требуют дальнейшего изучения.

Если AI составляет медицинский пример с конкретными расой и полом пациента, вы бы доверили ему выбрать эти признаки без отдельной проверки? Источник: Hacker News - Newest: ""AI" "LLM""

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​