Коротко
Новый бенчмарк проверяет не способность агента выполнить техническое ТЗ, а умение самому найти улучшение для модели мира. Результат выглядит многообещающе, но его сила ограничена искусственной средой и заранее заданным представлением данных.
AI-агенты уже можно проверять не только на написание кода по инструкции. В AutoWorldModel-Bench они сами улучшают модель мира, когда заранее не сказано, в каком направлении искать решение — и это гораздо ближе к исследовательской работе, чем обычный coding benchmark.
В 64 сессиях Codex-5.4 и Claude Opus 4.6 улучшили стартовую модель в 63 случаях. Причём в 91% успешных сессий победившее изменение было не подбором гиперпараметров, а полноценной исследовательской идеей: новым objective, представлением состояния, процедурой rollout или изменением архитектуры.
Схема теста довольно аккуратная. Агент работает с одной стартовой world model и ограниченным бюджетом вычислений, запускает её в восьми игровых окружениях и получает структурированное состояние игры: сущности и их параметры уже извлечены из среды и передаются в общем tensor-формате. Это позволяет быстро повторять эксперименты — один прогон занимает минуты — и отделяет моделирование динамики от распознавания картинки.
В этом и находится главный нюанс. Бенчмарк показывает, что агенты способны находить нетривиальные улучшения в заданной исследовательской песочнице. Но он пока не доказывает, что они так же хорошо формулируют проблемы, работают с шумными реальными данными или переносят найденные идеи между принципиально разными областями.
Ограничения существенные: исследование провели всего на 64 сессиях, набор состоит из восьми игровых сред, а представление состояния унифицировано и извлечено из игры заранее. Кроме того, направление улучшения действительно открытое, но сама задача всё равно начинается с готовой модели и фиксированного compute budget. Поэтому это важный шаг от «сделай по спецификации» к автономному поиску, но ещё не проверка полноценного AI-исследователя.
Какой следующий барьер важнее для таких агентов: работа с реальным восприятием или самостоятельная постановка научной задачи? Источник: cs.AI updates on arXiv.org