• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Steve A Johnson / Unsplash

Успех LLM-агентов здесь решил не диалог, а слой управления

Sh0ny
Sh0ny
13 августа 2026
  1. Главная
  2. Блог
  3. Успех LLM-агентов здесь решил не диалог, а слой управления
1 мин чтения

Коротко

В симуляции финансового сервиса связка LLM-агентов без общего ориентира быстро деградировала, а управляемый контур поднял долю целевых обращений на 32 процентных пункта. Но результат показывает не готовую технологию продаж, а важность политики управления — и пока только в искусственной среде.

Главный вывод работы неприятен для поклонников «просто добавим ещё одну LLM»: в многоагентном диалоге качество отдельных реплик не гарантирует полезный результат. Если у агентов противоположные цели и нет общего механизма координации, разговор может закончиться капитуляцией посетителя или застывшим поведением сайта — без достижения цели ни одной из сторон.

Авторы проверили это в симуляции финансового сервиса. Один агент должен был подвести посетителя к контакту с консультантом, второй — сохранял реалистичное сопротивление. Над ними работал Experience Orchestrator, который не столько «разговаривал лучше», сколько управлял траекторией диалога:

  • Contextual Bandit выбирал варианты контента на основе веб-аналитики;
  • PID-контроллер удерживал поведение в заданных рамках через динамические ограничения схемы;
  • POMDP-модель обновляла вероятностную оценку намерений посетителя.

В 60 000 симуляций такой контур довёл долю обращений посетителей с высоким намерением до 78,1% против 46,1% у наивного управления LLM. Особенно показательно, что выбор вариантов через Contextual Bandit объяснил 97% различий между результатами. Иными словами, решающим оказался не случайный набор исходных условий и не «эмпатия» модели, а политика, которая выбирает следующий ход.

Есть и важная оговорка. Для посетителей, изначально склонных к обращению, наивных эмпатичных реакций LLM оказалось достаточно. Настоящая ценность управляющего слоя проявилась на сложных сценариях, где естественной готовности к конверсии не было. Это похоже на инженерное правило: оркестрация нужна не всегда, а там, где система сама не удерживает цель.

Но до практического внедрения ещё далеко. Все результаты получены в симуляции LLM с LLM; PID-контроллер не проверяли на непредсказуемости реальных людей, а испытание на живом трафике авторы называют следующим критическим шагом. Поэтому цифры нельзя напрямую считать доказательством роста продаж или эффективности на сайте.

Вопрос теперь практический: вы бы доверили такой управляющий контур реальным клиентским диалогам до проверки на живых людях или сначала оставили бы его только инструментом для симуляций? Источник: cs.AI updates on arXiv.org

новостиaiагентыllm
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​