• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Juanjo Jaramillo / Unsplash

ИИ может знать правильные ценности и всё равно ошибаться в ситуации

Sh0ny
Sh0ny
18 августа 2026
  1. Главная
  2. Блог
  3. ИИ может знать правильные ценности и всё равно ошибаться в ситуации
1 мин чтения

Коротко

Большинство тестов морального мышления LLM проверяют, совпадают ли ответы с человеческими ценностями, но почти не проверяют применение норм в контексте. Разбор показывает, почему такой ИИ может звучать этично и принимать неверные решения.

Проблема не в том, что языковые модели обязательно «не понимают мораль». Проблема в том, что мы часто проверяем у них только половину навыка — какие ценности они называют правильными, но не умеют ли применить норму к конкретной ситуации.

Это важное различие. Легко согласиться с тезисом «нельзя причинять вред». Гораздо труднее определить, что именно считается вредом в данном контексте, какие обстоятельства меняют оценку поступка и какая норма здесь вообще применима.

Авторы статьи называют это разрывом между двумя задачами. Первая — moral value problem: совпадает ли ответ модели с человеческими моральными ценностями. Вторая — moral norm problem: может ли модель распознать ситуацию и корректно применить контекстно-зависимое правило.

Существующие оценки, по мнению авторов, заметно смещены в сторону первой задачи. Поэтому высокий результат может означать не развитое моральное рассуждение, а способность воспроизводить социально приемлемые формулировки.

Для нормальной проверки нужны как минимум три вещи: качественные эталонные данные о применении норм, оценка промежуточного рассуждения и проверка того, какие признаки ситуации модель считает морально значимыми. Авторы также предлагают формализовать нормативные теории и разделять в тестах уровень ценностей и уровень норм.

Ограничения у этого подхода тоже очевидны. В статье прямо отмечается нехватка качественных данных с экспертной разметкой, недостаточное внимание к процессу рассуждения и отсутствие устоявшихся формальных представлений о нормах. Пока этого нет, результаты тестов легко переинтерпретировать: принять убедительный моральный ответ за способность принимать моральные решения.

Практический вывод для разработчиков простой: если модель используется в чувствительном контексте, тестировать нужно не только её декларации о добре и зле, но и разбор конкретных случаев с меняющимися обстоятельствами. Иначе мы измеряем моральный словарь, а не моральную компетентность.

Где в ваших задачах модель чаще ошибается: в выборе ценностей или в применении правильного правила к конкретной ситуации?

Источник: cs.AI updates on arXiv.org

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​