Коротко
Главная проблема исследовательских агентов может быть не в поиске статей или написании кода, а в том, как они делят большой проект на совместимые задачи. Project2Task показывает, что граф зависимостей и чёткие контракты задач заметно улучшают результат — хотя пока это проверено на небольшом тесте.
Автономный исследовательский агент может найти литературу, предложить гипотезу, написать код и подготовить черновик статьи. Но без нормального плана он легко превращает проект в набор разрозненных действий: задачи пересекаются, важные шаги теряются, а порядок экспериментов приходится координировать вручную.
Именно здесь Project2Task предлагает не новую модель, а прослойку планирования. Система разбивает проект на «атомы инноваций», связывает их в ориентированный граф и решает, как лучше разложить работу: по параллельным направлениям, по уровням зависимостей или гибридно.
На выходе получается не список вроде «изучить тему и провести эксперименты», а контракт для каждой задачи. В нём указаны цель, входные данные, ожидаемый артефакт, требования к оценке, границы работы, зависимости и порядок выполнения.
Это важное различие. Агент-исполнитель может быть вполне способным, но если ему выдать плохо нарезанную работу, он будет масштабировать не исследование, а хаос. Контракты Project2Task при этом не привязаны к конкретному исполнителю — их можно подключать к другим системам.
В тесте на десяти проектных брифах, из которых получилось около 30 задач, средняя оценка качества портфеля составила 7,15 против 4,58 у базового подхода по краткому описанию и 5,31 у подхода, использующего только тему. При интеграции с AutoResearchClaw точность выполнения задач выросла с 0,536 до 0,759.
Но результаты пока не стоит воспринимать как доказательство готовности автономных научных лабораторий. Выборка небольшая, около 30 задач, а качество портфеля оценивалось по рукописям. В источнике также не раскрыты детали, которые помогли бы понять, насколько хорошо метод работает на других типах исследований и насколько устойчивы эти улучшения вне выбранного сценария.
Практический вывод простой: при создании собственного исследовательского агента стоит сначала проектировать не чат с моделью, а схему декомпозиции — кто за что отвечает, какие артефакты должен вернуть и от каких результатов зависит следующий шаг. Что чаще ломает ваши AI-проекты: слабая модель или отсутствие нормальных границ между задачами? Источник: cs.AI updates on arXiv.org