• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Brecht Corbeel / Unsplash

Новый бенчмарк проверяет, умеет ли AI открывать правила с нуля

Sh0ny
Sh0ny
15 августа 2026
  1. Главная
  2. Блог
  3. Новый бенчмарк проверяет, умеет ли AI открывать правила с нуля
1 мин чтения

Коротко

DiG-bench убирает главное, что обычно помогает AI: заранее известную цель. Вместо этого агенту приходится ставить эксперименты, замечать закономерности и угадывать даже условия победы — почти как в миниатюрном научном исследовании.

Самая интересная часть нового бенчмарка DiG-bench — не 70 игр, а отсутствие инструкции к ним. Агенту не сообщают правила преобразований и даже не объясняют, что именно считается победой. Сначала нужно понять саму задачу, а уже потом решить её.

Это заметно отличается от привычных тестов, где цель сформулирована заранее: написать код, ответить на вопрос или выбрать правильный вариант. Здесь проверяется цепочка, которая ближе к исследованию: выдвинуть гипотезу, провести эксперимент, отсеять ошибочную идею и перенести найденное правило на следующий уровень.

Каждая игра задаётся короткой строкой и имеет собственные правила. Всего предусмотрено семь уровней сложности. Нижний уровень, по данным авторов, регулярно решают несколько моделей, а верхний уже создаёт проблемы даже для сильных моделей, работающих внутри агентских систем.

В этом и есть практическая ценность DiG-bench: он отделяет умение следовать инструкции от способности разобраться в неизвестной среде. Модель может выглядеть очень убедительно в задачах с понятной формулировкой, но потеряться, когда сначала нужно определить, какую задачу вообще решать.

Ограничения тоже существенные. Из 70 игр публично опубликована только 21, а остальные оставлены закрытыми для защищённой оценки. Поэтому независимая проверка полного набора невозможна. Кроме того, факт, что каждую игру с первой попытки решил хотя бы один человек, не означает, что это легко для людей в среднем — человеческая планка здесь обозначена довольно грубо.

Если AI не дают цель и правила, что важнее для прогресса: более сильная модель или более умелый цикл экспериментов вокруг неё? Источник: cs.AI updates on arXiv.org

новостиaiагентынаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​