• Home
  • News
  • Blog
  • Releases
  • LLM history
  • Compare LLMs
  • Library
  • About
⌘K
Sign in

A blog and notes on development. The easiest way to reach me is via the social links below.

Contacts
talalaev.misha@gmail.com
Documents
Personal data processing policyPersonal data processing consent
Photo: Juanjo Jaramillo / Unsplash

AI can know the right values and still get the situation wrong

Sh0ny
Sh0ny
18 августа 2026
  1. Home
  2. Blog
  3. AI can know the right values and still get the situation wrong
1 min read

In short

Most tests of moral reasoning in LLMs check whether answers match human values, but hardly test how norms are applied in context. The breakdown shows why such an AI can sound ethical and still make the wrong decisions.

Проблема не в том, что языковые модели обязательно «не понимают мораль». Проблема в том, что мы часто проверяем у них только половину навыка — какие ценности они называют правильными, но не умеют ли применить норму к конкретной ситуации.

Это важное различие. Легко согласиться с тезисом «нельзя причинять вред». Гораздо труднее определить, что именно считается вредом в данном контексте, какие обстоятельства меняют оценку поступка и какая норма здесь вообще применима.

Авторы статьи называют это разрывом между двумя задачами. Первая — moral value problem: совпадает ли ответ модели с человеческими моральными ценностями. Вторая — moral norm problem: может ли модель распознать ситуацию и корректно применить контекстно-зависимое правило.

Существующие оценки, по мнению авторов, заметно смещены в сторону первой задачи. Поэтому высокий результат может означать не развитое моральное рассуждение, а способность воспроизводить социально приемлемые формулировки.

Для нормальной проверки нужны как минимум три вещи: качественные эталонные данные о применении норм, оценка промежуточного рассуждения и проверка того, какие признаки ситуации модель считает морально значимыми. Авторы также предлагают формализовать нормативные теории и разделять в тестах уровень ценностей и уровень норм.

Ограничения у этого подхода тоже очевидны. В статье прямо отмечается нехватка качественных данных с экспертной разметкой, недостаточное внимание к процессу рассуждения и отсутствие устоявшихся формальных представлений о нормах. Пока этого нет, результаты тестов легко переинтерпретировать: принять убедительный моральный ответ за способность принимать моральные решения.

Практический вывод для разработчиков простой: если модель используется в чувствительном контексте, тестировать нужно не только её декларации о добре и зле, но и разбор конкретных случаев с меняющимися обстоятельствами. Иначе мы измеряем моральный словарь, а не моральную компетентность.

Где в ваших задачах модель чаще ошибается: в выборе ценностей или в применении правильного правила к конкретной ситуации?

Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
More AI-tool write-ups on the Telegram channel — short and to the point
Subscribe on Telegram

Comments

(0)
​