• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Andrey Matveev / Unsplash

Отмена требования не работает: LLM может продолжить ему следовать

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. Отмена требования не работает: LLM может продолжить ему следовать
2 мин чтения

Коротко

В многошаговом диалоге модель может продолжать выполнять уже отменённое условие, даже если сама пишет, что оно больше не действует. Исследование предлагает способ заранее измерить такой срыв и уменьшить его без доступа к внутренностям модели.

Самая неприятная ошибка многошагового диалога — не когда модель не поняла новое требование, а когда она не отпустила старое. Пользователь отменяет условие, модель подтверждает отмену, а затем всё равно продолжает ему следовать.

Авторы называют это behavioral relapse — поведенческим рецидивом, или инерцией отмены. И это важный сдвиг в постановке проблемы: речь не о случайной «забывчивости» модели, а о свойстве состояния диалога, которое можно измерять по каждому отдельному условию.

Для этого предлагается contract ledger — журнал обязательств. Каждое требование связывается с исполняемой проверкой, отменённые условия помечаются как tombstones, а перед выдачей ответа система собирает актуальный набор ограничений в одну спецификацию.

Идея практически полезная: вместо надежды на то, что модель сама разберётся в длинной истории сообщений, ей заранее передают уже очищенное состояние контракта. Проверка работает через API модели, без доступа к её внутренним весам.

В экспериментах на задачах HumanEval с проверяемыми условиями частота рецидива у модели уровня 8B росла вместе с числом ограничений. При этом у более сильных моделей показатель оставался на минимальном уровне. Предварительная компиляция состояния заметно снижала число нарушений по сравнению с подходом «попробовали — проверили — повторили» при сопоставимых модели, проверках и бюджете.

Есть и более скромный вариант: короткая заметка об отмене требования возвращала примерно треть эффекта компиляции. А адаптивная лестница дополнительных исправлений поверх компиляции не дала обнаружимого прироста. Это хороший антидот против идеи, что ещё один раунд самопроверки автоматически решит проблему.

Ограничения тоже существенны. Метод проверяли на задачах HumanEval и формализованных условиях, поэтому переносимость на обычные разговоры, где требования расплывчаты и не имеют исполняемого чекера, остаётся открытым вопросом. Подход требует дополнительных проверок и API-вычислений для каждого результата. Кроме того, сам факт того, что модель написала «условие отменено», нельзя считать доказательством: поведение после этой фразы может говорить обратное.

Если модель не умеет надёжно забывать отменённые требования, готовы ли мы доверять ей длинные диалоги без отдельного журнала состояния? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​