Коротко
Большинство тестов морального мышления LLM проверяют, совпадают ли ответы с человеческими ценностями, но почти не проверяют применение норм в контексте. Разбор показывает, почему такой ИИ может звучать этично и принимать неверные решения.
Проблема не в том, что языковые модели обязательно «не понимают мораль». Проблема в том, что мы часто проверяем у них только половину навыка — какие ценности они называют правильными, но не умеют ли применить норму к конкретной ситуации.
Это важное различие. Легко согласиться с тезисом «нельзя причинять вред». Гораздо труднее определить, что именно считается вредом в данном контексте, какие обстоятельства меняют оценку поступка и какая норма здесь вообще применима.
Авторы статьи называют это разрывом между двумя задачами. Первая — moral value problem: совпадает ли ответ модели с человеческими моральными ценностями. Вторая — moral norm problem: может ли модель распознать ситуацию и корректно применить контекстно-зависимое правило.
Существующие оценки, по мнению авторов, заметно смещены в сторону первой задачи. Поэтому высокий результат может означать не развитое моральное рассуждение, а способность воспроизводить социально приемлемые формулировки.
Для нормальной проверки нужны как минимум три вещи: качественные эталонные данные о применении норм, оценка промежуточного рассуждения и проверка того, какие признаки ситуации модель считает морально значимыми. Авторы также предлагают формализовать нормативные теории и разделять в тестах уровень ценностей и уровень норм.
Ограничения у этого подхода тоже очевидны. В статье прямо отмечается нехватка качественных данных с экспертной разметкой, недостаточное внимание к процессу рассуждения и отсутствие устоявшихся формальных представлений о нормах. Пока этого нет, результаты тестов легко переинтерпретировать: принять убедительный моральный ответ за способность принимать моральные решения.
Практический вывод для разработчиков простой: если модель используется в чувствительном контексте, тестировать нужно не только её декларации о добре и зле, но и разбор конкретных случаев с меняющимися обстоятельствами. Иначе мы измеряем моральный словарь, а не моральную компетентность.
Где в ваших задачах модель чаще ошибается: в выборе ценностей или в применении правильного правила к конкретной ситуации?
Источник: cs.AI updates on arXiv.org