Коротко
В симуляции финансового сервиса связка LLM-агентов без общего ориентира быстро деградировала, а управляемый контур поднял долю целевых обращений на 32 процентных пункта. Но результат показывает не готовую технологию продаж, а важность политики управления — и пока только в искусственной среде.
Главный вывод работы неприятен для поклонников «просто добавим ещё одну LLM»: в многоагентном диалоге качество отдельных реплик не гарантирует полезный результат. Если у агентов противоположные цели и нет общего механизма координации, разговор может закончиться капитуляцией посетителя или застывшим поведением сайта — без достижения цели ни одной из сторон.
Авторы проверили это в симуляции финансового сервиса. Один агент должен был подвести посетителя к контакту с консультантом, второй — сохранял реалистичное сопротивление. Над ними работал Experience Orchestrator, который не столько «разговаривал лучше», сколько управлял траекторией диалога:
В 60 000 симуляций такой контур довёл долю обращений посетителей с высоким намерением до 78,1% против 46,1% у наивного управления LLM. Особенно показательно, что выбор вариантов через Contextual Bandit объяснил 97% различий между результатами. Иными словами, решающим оказался не случайный набор исходных условий и не «эмпатия» модели, а политика, которая выбирает следующий ход.
Есть и важная оговорка. Для посетителей, изначально склонных к обращению, наивных эмпатичных реакций LLM оказалось достаточно. Настоящая ценность управляющего слоя проявилась на сложных сценариях, где естественной готовности к конверсии не было. Это похоже на инженерное правило: оркестрация нужна не всегда, а там, где система сама не удерживает цель.
Но до практического внедрения ещё далеко. Все результаты получены в симуляции LLM с LLM; PID-контроллер не проверяли на непредсказуемости реальных людей, а испытание на живом трафике авторы называют следующим критическим шагом. Поэтому цифры нельзя напрямую считать доказательством роста продаж или эффективности на сайте.
Вопрос теперь практический: вы бы доверили такой управляющий контур реальным клиентским диалогам до проверки на живых людях или сначала оставили бы его только инструментом для симуляций? Источник: cs.AI updates on arXiv.org