In short
Most tests of moral reasoning in LLMs check whether answers match human values, but hardly test how norms are applied in context. The breakdown shows why such an AI can sound ethical and still make the wrong decisions.
Проблема не в том, что языковые модели обязательно «не понимают мораль». Проблема в том, что мы часто проверяем у них только половину навыка — какие ценности они называют правильными, но не умеют ли применить норму к конкретной ситуации.
Это важное различие. Легко согласиться с тезисом «нельзя причинять вред». Гораздо труднее определить, что именно считается вредом в данном контексте, какие обстоятельства меняют оценку поступка и какая норма здесь вообще применима.
Авторы статьи называют это разрывом между двумя задачами. Первая — moral value problem: совпадает ли ответ модели с человеческими моральными ценностями. Вторая — moral norm problem: может ли модель распознать ситуацию и корректно применить контекстно-зависимое правило.
Существующие оценки, по мнению авторов, заметно смещены в сторону первой задачи. Поэтому высокий результат может означать не развитое моральное рассуждение, а способность воспроизводить социально приемлемые формулировки.
Для нормальной проверки нужны как минимум три вещи: качественные эталонные данные о применении норм, оценка промежуточного рассуждения и проверка того, какие признаки ситуации модель считает морально значимыми. Авторы также предлагают формализовать нормативные теории и разделять в тестах уровень ценностей и уровень норм.
Ограничения у этого подхода тоже очевидны. В статье прямо отмечается нехватка качественных данных с экспертной разметкой, недостаточное внимание к процессу рассуждения и отсутствие устоявшихся формальных представлений о нормах. Пока этого нет, результаты тестов легко переинтерпретировать: принять убедительный моральный ответ за способность принимать моральные решения.
Практический вывод для разработчиков простой: если модель используется в чувствительном контексте, тестировать нужно не только её декларации о добре и зле, но и разбор конкретных случаев с меняющимися обстоятельствами. Иначе мы измеряем моральный словарь, а не моральную компетентность.
Где в ваших задачах модель чаще ошибается: в выборе ценностей или в применении правильного правила к конкретной ситуации?
Источник: cs.AI updates on arXiv.org