Коротко
LLM часто совпадают с людьми в итоговой оценке моральных ситуаций, но приходят к ней через другие принципы и приоритеты. Поэтому одного правильного ярлыка недостаточно: проверять нужно ещё и объяснение решения.
Модель может вынести тот же моральный вердикт, что и человек, но опираться при этом на совершенно другую логику. Для оценки alignment это важная ловушка: совпадение ответа создаёт ощущение безопасности, хотя ценности и контекст, стоящие за ним, могут расходиться.
Авторы проверили это на 500 задачах из ETHICS, охватывающих пять областей моральных суждений. У frontier- и open-моделей итоговые метки часто совпадали с большинством человеческих оценок. Если смотреть только на такие метки, результат выглядит убедительно.
Но анализ обоснований показал систематические различия. Люди и модели по-разному распределяли внимание между вредом, уважением, соблюдением обещаний, справедливостью, заслугами и тем, насколько важны оправдывающие обстоятельства.
Практический вывод простой: тест с вариантами «правильно/неправильно» измеряет скорее похожесть результата, чем alignment. Если модель должна принимать решения в неоднозначных ситуациях, нужно анализировать не только финальный ответ, но и причины, моральные приоритеты и трактовку контекста.
Ограничение исследования тоже существенно: речь идёт о специально собранном бенчмарке из 500 задач и текстовых обоснованиях. Из abstract неясно, насколько такие расхождения проявятся в реальных продуктах и можно ли надёжно оценивать качество самих объяснений модели. Поэтому работа показывает проблему, но не даёт готового способа измерять «настоящий» alignment.
Если модель отвечает как человек, но объясняет решение другой моральной логикой, считаете ли вы это приемлемым результатом?
Источник: cs.AI updates on arXiv.org