Коротко
DiG-bench убирает главное, что обычно помогает AI: заранее известную цель. Вместо этого агенту приходится ставить эксперименты, замечать закономерности и угадывать даже условия победы — почти как в миниатюрном научном исследовании.
Самая интересная часть нового бенчмарка DiG-bench — не 70 игр, а отсутствие инструкции к ним. Агенту не сообщают правила преобразований и даже не объясняют, что именно считается победой. Сначала нужно понять саму задачу, а уже потом решить её.
Это заметно отличается от привычных тестов, где цель сформулирована заранее: написать код, ответить на вопрос или выбрать правильный вариант. Здесь проверяется цепочка, которая ближе к исследованию: выдвинуть гипотезу, провести эксперимент, отсеять ошибочную идею и перенести найденное правило на следующий уровень.
Каждая игра задаётся короткой строкой и имеет собственные правила. Всего предусмотрено семь уровней сложности. Нижний уровень, по данным авторов, регулярно решают несколько моделей, а верхний уже создаёт проблемы даже для сильных моделей, работающих внутри агентских систем.
В этом и есть практическая ценность DiG-bench: он отделяет умение следовать инструкции от способности разобраться в неизвестной среде. Модель может выглядеть очень убедительно в задачах с понятной формулировкой, но потеряться, когда сначала нужно определить, какую задачу вообще решать.
Ограничения тоже существенные. Из 70 игр публично опубликована только 21, а остальные оставлены закрытыми для защищённой оценки. Поэтому независимая проверка полного набора невозможна. Кроме того, факт, что каждую игру с первой попытки решил хотя бы один человек, не означает, что это легко для людей в среднем — человеческая планка здесь обозначена довольно грубо.
Если AI не дают цель и правила, что важнее для прогресса: более сильная модель или более умелый цикл экспериментов вокруг неё? Источник: cs.AI updates on arXiv.org