• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Google DeepMind / Unsplash

Агент не решил ни одной задачи, но локализовал источник сбоя

Sh0ny
Sh0ny
6 августа 2026
  1. Главная
  2. Блог
  3. Агент не решил ни одной задачи, но локализовал источник сбоя
2 мин чтения

Коротко

Исследователи построили систему, в которой языковая модель не может сама объявить свои убеждения истинными: решения принимает детерминированный исполнитель, а гипотезы проверяются кодом. Результат одновременно полезный и отрезвляющий: механизм отказа удалось разделить на измеримые части, но практическая эффективность агента осталась нулевой.

Главный результат этой работы — не новый способ решать задачи, а способ честно обнаруживать, почему агент их не решает. Авторы построили инструмент для проверки long-horizon-агентов и получили чистый эксперимент: один механизм можно отключить, не смешивая его сбой с ошибками остальных компонентов.

Архитектура специально лишает LLM права быть единственным источником истины. Языковая модель может только отправлять типизированные предложения, а все убеждения хранит детерминированный Executive. Заявление принимается лишь в том случае, если прогноз был зарегистрирован до действия, а затем совпал с наблюдением — это проверяется кодом, а не самоотчётом агента.

Такой дизайн важнее привычного «давайте посмотрим логи». Логи и внутреннее состояние агента могут быть частью проблемы, поэтому система проверяет не объяснение модели задним числом, а заранее зафиксированное предсказание. Более того, запуск автоматически признаётся недействительным, если нарушены пороги ошибок записи, размера рендера или эхо-проверки salted canary. В первых восьми архитектурных запусках четыре были отброшены таким образом — и каждый раз это позволило найти реальный дефект.

Есть и ещё один аккуратный ход: скрытая reference-реализация компилирует план, который система приняла бы в полном режиме, даже если проверяемый механизм отключён в конкретной абляции. Поэтому метрики дрейфа остаются определёнными и в эксперименте, где сам механизм уже удалён. Без такого контрольного слоя легко принять отсутствие измерения за отсутствие сбоя.

Результат по commitment-механизму получился показательно однозначным. После его отключения отказ от цели вырос с 0,00 до 1,00, а binding error остался на уровне 0,00. Это означает, что «агент бросил цель» и «агент нарушил привязку» здесь не одно и то же: первый сбой действительно связан с commitment, второй — нет.

Почему binding не начал проявляться как постепенный дрейф после отключения своего ремонта? Потому что этот канал принадлежит коду, а не языковой модели. Его отказ структурно поглощается системой и проявляется уровнем выше — как обрушение формирования гипотез. Это хороший пример того, зачем вообще нужна декомпозиция: она показывает не только место поломки, но и форму, в которой ошибка может исчезнуть из наблюдаемого слоя.

Но есть ограничение, которое нельзя прятать в сноске. На ARC-AGI-3 система получила ноль завершённых задач в 52 прошедших проверку запусках. Авторы заранее зарегистрировали это как structural defeater — результат, опровергающий претензию на практическую эффективность.

Именно поэтому работу стоит читать не как демонстрацию сильного агента, а как методологический прототип. Она показывает, как отделять доказуемую причинность от убедительного рассказа модели о собственном поведении. Для разработки агентов это полезный сдвиг: сначала нужно научиться валидировать эксперимент и локализовать дрейф, а уже потом делать выводы о способности системы работать на длинном горизонте.

Источник: cs.AI updates on arXiv.org

новостиaiагентыразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​