Коротко
Разложение ARC-AGI-3-агента на компоненты показало: основную прибавку даёт сила модели и глубина推理, а не executable world model или simplification. Verification побеждает, но дорого.
Исследователи разобрали свой предыдущий ARC-AGI-3-агент по косточкам. Раньше в нём было упаковано три идеи — executable world model, scheduled simplification и exact replay verification — и было непонятно, какая именно тянула результат. Ответ оказался контринтуитивным: ни одна из них не работает так, как ожидалось.
Собрали четыре вложенных агента на базе Codex: текстовый бейзлайн; executable world model без верификации; тот же вариант с упрощением; и полный — с фиксированным интерфейсом, упрощением и точным воспроизведением наблюдений. Прогнали всё на gpt-5.4 и gpt-5.5 при уровнях reasoning effort high и xhigh.
Самый устойчивый результат — не про архитектуру. Каждый вариант агента улучшается при переходе к более сильной модели и при повышении reasoning effort. Разница между архитектурами внутри одного модельно-усилийного сетапа оказалась меньше ожидаемой. Проще говоря: бери модель помощнее и дай ей больше токенов на размышление — это даст больше, чем перестройка пайплайна.
Требование persistent executable deliverable не всегда полезно. Текстовый вариант — самый простой, без исполняемого мира — обошёл flexible-interface executable вариант в обоих сетапах gpt-5.5. Упрощение помогает в трёх из четырёх конфигураций, но в слабейшей — нет. Полная верификация заняла первое место везде, но ценой существенно больших ресурсов.
В exploratory-фоллоу-апе на gpt-5.6-sol вариант с верификацией решил все публичные игры на обоих уровнях effort, достиг ~99% RHAE и использовал меньше половины действий человеческого бейзлайна. Звучит как победа — но авторы честно оговариваются: модель вышла после создания этих игр, и held-out производительность не проверена. Это насыщение публичного сета, а не доказательство обобщающей способности.
Практический вывод для тех, кто строит агентов: не стоит усложнять архитектуру ради усложнения. Компоненты вроде executable world model могут даже навредить в определённых конфигурациях. Верификация — единственный компонент, который стабильно побеждает, но платишь за это ресурсами. Главный рычаг — модель и глубина рассуждений, а не хитрый оркестратор поверх неё.
Источник: cs.AI updates on arXiv.org