• Home
  • News
  • Blog
  • Releases
  • LLM history
  • Compare LLMs
  • Library
  • About
⌘K
Sign in

A blog and notes on development. The easiest way to reach me is via the social links below.

Contacts
talalaev.misha@gmail.com
Documents
Personal data processing policyPersonal data processing consent
Photo: Raghav Bhasin / Unsplash

Agents need not speak all the time — but a KL gate does not work everywhere

Sh0ny
Sh0ny
18 августа 2026
  1. Home
  2. Blog
  3. Agents need not speak all the time — but a KL gate does not work everywhere
1 min read

In short

A new approach teaches agents to exchange messages only when their internal representations of the world diverge substantially. But the main finding is not a blanket win over the baselines: the belief model itself contributes quality even when the filtering mechanism is barely used.

В многоагентных системах проблема не только в том, что именно сообщать, но и в том, когда вообще открывать канал связи. Новый подход предлагает простой критерий: агент отправляет сообщение, если KL-дивергенция между его распределением убеждений и убеждениями других агентов превышает заданный порог.

Это интереснее обычного бинарного гейта, обучаемого через REINFORCE. Такой гейт может давать нестабильное и плохо объяснимое поведение. Здесь же есть понятная логика: если агенты по-разному оценивают скрытое состояние мира, обмен информацией оправдан; если их представления близки, можно промолчать.

Но универсального триумфа не получилось. На Predator-Prey в среде 10×10 IC3Net оказался лучше KL-belief при всех проверенных порогах. Зато в более сложной среде 20×20 с ε=0.5 новый метод показал 73,84 шага и 42% успешных эпизодов против 75,31 шага и 31% у IC3Net. Разница — 11 процентных пунктов в пользу KL-belief, причём с меньшим разбросом между запусками.

Самый неожиданный результат обнаружился в MPE simple_spread: голова убеждений повысила среднюю награду на 12 пунктов и снизила дисперсию в 26 раз даже тогда, когда сам гейтинг не работал. Похоже, здесь есть два разных эффекта: фильтр сообщений помогает, когда представления агентов расходятся, а улучшенное внутреннее представление может усиливать координацию само по себе.

Ограничения существенные: выводы основаны на двух бенчмарках и пяти запусках для каждого варианта. Фиксированный порог требует подбора, на простом PP 10×10 метод проиграл IC3Net, а результаты не показывают, что KL-гейт будет лучше на реальных задачах. Поэтому воспринимать его стоит не как готовую замену существующим протоколам, а как интерпретируемое правило для экспериментов с коммуникацией.

Если вы строите систему из нескольких агентов, что кажется более ценным именно в вашей задаче: возможность объяснить, почему агент заговорил, или максимальное качество независимо от причины? Источник: cs.AI updates on arXiv.org

новостиагентыaiразработка
More AI-tool write-ups on the Telegram channel — short and to the point
Subscribe on Telegram

Comments

(0)
​