Коротко
Исследование 9 840 переговоров показывает: способность агента договориться ещё не означает выгодный и надёжный контракт. На результат сильнее всего влияют модель поставщика и настройки стратегической терпеливости в промпте.
Автономный агент может почти всегда довести переговоры до соглашения, но это не гарантирует хорошую сделку. В эксперименте агенты договорились в 98,9% случаев и собрали 95,4% от теоретически доступной выгоды — правда, лишние раунды переговоров съели ещё 21–34% этого результата.
Это важный сдвиг в критериях оценки. Для закупочного агента мало проверить, умеет ли он торговаться и находить компромисс. Нужно смотреть, сколько времени он тратит на соглашение, не принимает ли убыточные условия и кому в итоге достаётся созданная стоимость.
В исследовании девять LLM из экосистем OpenAI, Google и Alibaba провели 9 840 переговоров друг с другом. Средний агенту понадобилось 2,98 раунда против 1,25 у эталонной модели равновесия. То есть внешне успешный диалог может быть заметно хуже короткого и рационального торга.
Причём распределение выгоды оказалось связано не столько с рейтингом способностей, сколько с происхождением модели. В self-play покупатель в среднем забирал 40% у OpenAI, 50% у Google и 70% у Qwen от Alibaba. Если поменять поставщика, доля менялась на 7–18 процентных пунктов. Выбор вендора здесь становится не только техническим, но и экономическим решением.
Промпт тоже способен менять результат сильнее, чем сама «умность» модели. Авторы разделяют экономическую терпеливость владельца бизнеса и стратегическую терпеливость, заданную агенту в инструкции: именно этот бесплатный параметр объяснял 90% вариации в разделе выгоды.
Ограничения исследования тоже существенны. Речь идёт о канонической задаче цепочки поставок: покупатель знает свой спрос, продавец — нет, а стороны торгуются количеством и оплатой. Это не полноценная проверка реальных закупок. Кроме того, базовые модели принимали индивидуально невыгодные контракты в 19,2% случаев; у моделей среднего и флагманского уровня показатель составлял 0–0,6%. Значит, автоматическая проверка прибыльности — обязательный предохранитель, особенно для слабых моделей.
Практический вывод простой: перед запуском агента нужно тестировать не только среднюю выгоду, но и задержку, худшие контракты и перекос в пользу одной стороны. И отдельно фиксировать промпт: изменение «терпеливости» может перераспределить деньги без единого обновления модели.
Если бы вы делегировали агенту закупки, что считали бы опаснее: несколько лишних раундов торга или систематический перекос сделки в пользу поставщика? Источник: cs.AI updates on arXiv.org