• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

На ARC-AGI-3 мощная модель важнее хитрой архитектуры агента

Sh0ny
Sh0ny
20 июля 2026
  1. Главная
  2. Блог
  3. На ARC-AGI-3 мощная модель важнее хитрой архитектуры агента
1 мин чтения
Обновлено 25 июля 2026

Коротко

Разложение ARC-AGI-3-агента на компоненты показало: основную прибавку даёт сила модели и глубина推理, а не executable world model или simplification. Verification побеждает, но дорого.

Исследователи разобрали свой предыдущий ARC-AGI-3-агент по косточкам. Раньше в нём было упаковано три идеи — executable world model, scheduled simplification и exact replay verification — и было непонятно, какая именно тянула результат. Ответ оказался контринтуитивным: ни одна из них не работает так, как ожидалось.

Собрали четыре вложенных агента на базе Codex: текстовый бейзлайн; executable world model без верификации; тот же вариант с упрощением; и полный — с фиксированным интерфейсом, упрощением и точным воспроизведением наблюдений. Прогнали всё на gpt-5.4 и gpt-5.5 при уровнях reasoning effort high и xhigh.

Самый устойчивый результат — не про архитектуру. Каждый вариант агента улучшается при переходе к более сильной модели и при повышении reasoning effort. Разница между архитектурами внутри одного модельно-усилийного сетапа оказалась меньше ожидаемой. Проще говоря: бери модель помощнее и дай ей больше токенов на размышление — это даст больше, чем перестройка пайплайна.

Требование persistent executable deliverable не всегда полезно. Текстовый вариант — самый простой, без исполняемого мира — обошёл flexible-interface executable вариант в обоих сетапах gpt-5.5. Упрощение помогает в трёх из четырёх конфигураций, но в слабейшей — нет. Полная верификация заняла первое место везде, но ценой существенно больших ресурсов.

В exploratory-фоллоу-апе на gpt-5.6-sol вариант с верификацией решил все публичные игры на обоих уровнях effort, достиг ~99% RHAE и использовал меньше половины действий человеческого бейзлайна. Звучит как победа — но авторы честно оговариваются: модель вышла после создания этих игр, и held-out производительность не проверена. Это насыщение публичного сета, а не доказательство обобщающей способности.

Практический вывод для тех, кто строит агентов: не стоит усложнять архитектуру ради усложнения. Компоненты вроде executable world model могут даже навредить в определённых конфигурациях. Верификация — единственный компонент, который стабильно побеждает, но платишь за это ресурсами. Главный рычаг — модель и глубина рассуждений, а не хитрый оркестратор поверх неё.

Источник: cs.AI updates on arXiv.org

новостиaillmагенты
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​