Коротко
LLM-агенты часто тратят вызовы и токены не на решение задачи, а на поиск совместимых инструментов. HyperAgent предлагает строить план вокруг входных и выходных схем и динамически закрывать недостающие зависимости.
Проблема tool-use-агентов часто выглядит как проблема рассуждения: модель не смогла понять, какие API вызвать и в каком порядке. Но у этой ошибки есть более приземлённая причина — инструменты обычно описаны текстом, а их реальные связи между входами и выходами остаются неявными.
Работа HyperAgent предлагает перенести планирование на уровень схем данных. Авторы представляют инструменты как гиперрёбра ориентированного Tool–Schema Hypergraph: входные схемы становятся узлами, а инструмент связывает их с выходными схемами. Это позволяет описывать не просто список доступных API, а зависимости между тем, что уже есть у агента, и тем, что он может получить следующим вызовом.
Для конкретной задачи система сначала выделяет релевантный фрагмент графа и строит schema-aware Task DAG — направленный ациклический граф подзадач. Во время выполнения план не считается зафиксированным: HyperAgent ищет нерешённые требования текущего состояния и расширяет граф инструментами, которые могут их закрыть.
Это важное отличие от подхода «пусть LLM сама догадается о композиции инструментов по описаниям». Агент получает более явный механизм проверки совместимости: если для следующего шага не хватает входной схемы, поиск начинается от этого дефицита, а не перебором потенциально подходящих API.
В экспериментах на AppWorld HyperAgent показал более высокую успешность выполнения задач по сравнению с базовыми агентами, одновременно сократив число лишних API-вызовов, взаимодействий с LLM и потребление токенов. В аннотации нет конкретных значений улучшения, поэтому воспринимать это как доказательство универсального превосходства пока нельзя.
Практический вывод для разработчиков агентных систем простой: каталог инструментов стоит проектировать не только как набор текстовых инструкций для модели. Явные схемы входов и выходов могут стать рабочим слоем планирования, особенно когда ошибка в одном вызове порождает цепочку бесполезных попыток.
При этом HyperAgent не отменяет необходимость качественных описаний и не решает автоматически все проблемы исполнения во внешней среде. Он делает более формальной именно часть, связанную с зависимостями данных и выбором инструментов. Следующий вопрос — насколько хорошо такая схема переносится с AppWorld на нестабильные API, неоднозначные данные и инструменты с побочными эффектами.
Источник: cs.AI updates on arXiv.org