Коротко
Новые reasoning-модели показывают сильные результаты в рассуждениях, но это не сделало их медицинские примеры более репрезентативными. Разбираю, почему рост качества модели не заменяет отдельную проверку на расовые и гендерные перекосы.
В медицине опасен не только неправильный диагноз от AI. Не менее неприятный сценарий — когда модель уверенно описывает пациента через расовый или гендерный стереотип, а врач принимает такой пример за нейтральный.
Исследователи Flinders University проверили два reasoning-LLM: o3-mini и DeepSeek-R1. Они сгенерировали 36 000 клинических описаний вымышленных пациентов и сравнили распределение расы и пола с ожидаемым представлением разных групп при распространённых заболеваниях.
Результат неприятный: способность лучше рассуждать сама по себе не добавила справедливости. Для o3-mini исследователи обнаружили значимое искажение в 78% случаев по расе и в 56% по полу. У DeepSeek-R1 — в 89% и 67% соответственно. Для сравнения, у GPT-4 в предыдущем анализе было по 67% для обоих показателей.
Особенно заметным оказался перекос в сторону Black populations при описании состояний вроде sarcoidosis, systemic lupus erythematosus, pre-eclampsia и essential hypertension. Модели также часто преувеличивали долю «большинствующего» пола. То есть AI не просто ошибается случайным образом — он может превращать статистические ассоциации из обучающих данных в шаблон пациента.
Практический вывод для тех, кто внедряет LLM в медицину: benchmark на рассуждение не отвечает на вопрос, насколько модель безопасна и репрезентативна. Нужны отдельные проверки распределения демографических признаков и постоянный мониторинг, особенно если результат модели попадает в клинический рабочий процесс.
Но у исследования есть важные границы. Проверялись только два reasoning-LLM и именно сгенерированные клинические виньетки, а не реальные решения врачей или исходы лечения. Авторы также не утверждают, что причина обязательно в сознательном «предубеждении» модели: она может выбирать прототипические, а не репрезентативные случаи из-за закономерностей в обучающих данных. Это всё равно проблема, но механизм и реальный ущерб требуют дальнейшего изучения.
Если AI составляет медицинский пример с конкретными расой и полом пациента, вы бы доверили ему выбрать эти признаки без отдельной проверки? Источник: Hacker News - Newest: ""AI" "LLM""