• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Jakub Żerdzicki / Unsplash

AI-агенты ищут новые идеи, но пока только в игровых мирах

Sh0ny
Sh0ny
13 августа 2026
  1. Главная
  2. Блог
  3. AI-агенты ищут новые идеи, но пока только в игровых мирах
1 мин чтения

Коротко

Новый бенчмарк проверяет не способность агента выполнить техническое ТЗ, а умение самому найти улучшение для модели мира. Результат выглядит многообещающе, но его сила ограничена искусственной средой и заранее заданным представлением данных.

AI-агенты уже можно проверять не только на написание кода по инструкции. В AutoWorldModel-Bench они сами улучшают модель мира, когда заранее не сказано, в каком направлении искать решение — и это гораздо ближе к исследовательской работе, чем обычный coding benchmark.

В 64 сессиях Codex-5.4 и Claude Opus 4.6 улучшили стартовую модель в 63 случаях. Причём в 91% успешных сессий победившее изменение было не подбором гиперпараметров, а полноценной исследовательской идеей: новым objective, представлением состояния, процедурой rollout или изменением архитектуры.

Схема теста довольно аккуратная. Агент работает с одной стартовой world model и ограниченным бюджетом вычислений, запускает её в восьми игровых окружениях и получает структурированное состояние игры: сущности и их параметры уже извлечены из среды и передаются в общем tensor-формате. Это позволяет быстро повторять эксперименты — один прогон занимает минуты — и отделяет моделирование динамики от распознавания картинки.

В этом и находится главный нюанс. Бенчмарк показывает, что агенты способны находить нетривиальные улучшения в заданной исследовательской песочнице. Но он пока не доказывает, что они так же хорошо формулируют проблемы, работают с шумными реальными данными или переносят найденные идеи между принципиально разными областями.

Ограничения существенные: исследование провели всего на 64 сессиях, набор состоит из восьми игровых сред, а представление состояния унифицировано и извлечено из игры заранее. Кроме того, направление улучшения действительно открытое, но сама задача всё равно начинается с готовой модели и фиксированного compute budget. Поэтому это важный шаг от «сделай по спецификации» к автономному поиску, но ещё не проверка полноценного AI-исследователя.

Какой следующий барьер важнее для таких агентов: работа с реальным восприятием или самостоятельная постановка научной задачи? Источник: cs.AI updates on arXiv.org

новостиaiагентынаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​