Коротко
Новый подход учит агентов обмениваться сообщениями только при существенном расхождении во внутренних представлениях мира. Но главный результат не в универсальной победе над базовыми методами: качество даёт и сама модель убеждений, даже когда механизм фильтрации почти не используется.
В многоагентных системах проблема не только в том, что именно сообщать, но и в том, когда вообще открывать канал связи. Новый подход предлагает простой критерий: агент отправляет сообщение, если KL-дивергенция между его распределением убеждений и убеждениями других агентов превышает заданный порог.
Это интереснее обычного бинарного гейта, обучаемого через REINFORCE. Такой гейт может давать нестабильное и плохо объяснимое поведение. Здесь же есть понятная логика: если агенты по-разному оценивают скрытое состояние мира, обмен информацией оправдан; если их представления близки, можно промолчать.
Но универсального триумфа не получилось. На Predator-Prey в среде 10×10 IC3Net оказался лучше KL-belief при всех проверенных порогах. Зато в более сложной среде 20×20 с ε=0.5 новый метод показал 73,84 шага и 42% успешных эпизодов против 75,31 шага и 31% у IC3Net. Разница — 11 процентных пунктов в пользу KL-belief, причём с меньшим разбросом между запусками.
Самый неожиданный результат обнаружился в MPE simple_spread: голова убеждений повысила среднюю награду на 12 пунктов и снизила дисперсию в 26 раз даже тогда, когда сам гейтинг не работал. Похоже, здесь есть два разных эффекта: фильтр сообщений помогает, когда представления агентов расходятся, а улучшенное внутреннее представление может усиливать координацию само по себе.
Ограничения существенные: выводы основаны на двух бенчмарках и пяти запусках для каждого варианта. Фиксированный порог требует подбора, на простом PP 10×10 метод проиграл IC3Net, а результаты не показывают, что KL-гейт будет лучше на реальных задачах. Поэтому воспринимать его стоит не как готовую замену существующим протоколам, а как интерпретируемое правило для экспериментов с коммуникацией.
Если вы строите систему из нескольких агентов, что кажется более ценным именно в вашей задаче: возможность объяснить, почему агент заговорил, или максимальное качество независимо от причины? Источник: cs.AI updates on arXiv.org