Коротко
Исследователи построили систему, в которой языковая модель не может сама объявить свои убеждения истинными: решения принимает детерминированный исполнитель, а гипотезы проверяются кодом. Результат одновременно полезный и отрезвляющий: механизм отказа удалось разделить на измеримые части, но практическая эффективность агента осталась нулевой.
Главный результат этой работы — не новый способ решать задачи, а способ честно обнаруживать, почему агент их не решает. Авторы построили инструмент для проверки long-horizon-агентов и получили чистый эксперимент: один механизм можно отключить, не смешивая его сбой с ошибками остальных компонентов.
Архитектура специально лишает LLM права быть единственным источником истины. Языковая модель может только отправлять типизированные предложения, а все убеждения хранит детерминированный Executive. Заявление принимается лишь в том случае, если прогноз был зарегистрирован до действия, а затем совпал с наблюдением — это проверяется кодом, а не самоотчётом агента.
Такой дизайн важнее привычного «давайте посмотрим логи». Логи и внутреннее состояние агента могут быть частью проблемы, поэтому система проверяет не объяснение модели задним числом, а заранее зафиксированное предсказание. Более того, запуск автоматически признаётся недействительным, если нарушены пороги ошибок записи, размера рендера или эхо-проверки salted canary. В первых восьми архитектурных запусках четыре были отброшены таким образом — и каждый раз это позволило найти реальный дефект.
Есть и ещё один аккуратный ход: скрытая reference-реализация компилирует план, который система приняла бы в полном режиме, даже если проверяемый механизм отключён в конкретной абляции. Поэтому метрики дрейфа остаются определёнными и в эксперименте, где сам механизм уже удалён. Без такого контрольного слоя легко принять отсутствие измерения за отсутствие сбоя.
Результат по commitment-механизму получился показательно однозначным. После его отключения отказ от цели вырос с 0,00 до 1,00, а binding error остался на уровне 0,00. Это означает, что «агент бросил цель» и «агент нарушил привязку» здесь не одно и то же: первый сбой действительно связан с commitment, второй — нет.
Почему binding не начал проявляться как постепенный дрейф после отключения своего ремонта? Потому что этот канал принадлежит коду, а не языковой модели. Его отказ структурно поглощается системой и проявляется уровнем выше — как обрушение формирования гипотез. Это хороший пример того, зачем вообще нужна декомпозиция: она показывает не только место поломки, но и форму, в которой ошибка может исчезнуть из наблюдаемого слоя.
Но есть ограничение, которое нельзя прятать в сноске. На ARC-AGI-3 система получила ноль завершённых задач в 52 прошедших проверку запусках. Авторы заранее зарегистрировали это как structural defeater — результат, опровергающий претензию на практическую эффективность.
Именно поэтому работу стоит читать не как демонстрацию сильного агента, а как методологический прототип. Она показывает, как отделять доказуемую причинность от убедительного рассказа модели о собственном поведении. Для разработки агентов это полезный сдвиг: сначала нужно научиться валидировать эксперимент и локализовать дрейф, а уже потом делать выводы о способности системы работать на длинном горизонте.
Источник: cs.AI updates on arXiv.org