• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Tötös Ádám / Unsplash

Агент выживает дольше, когда направляет внимание на главную нехватку

Sh0ny
Sh0ny
6 августа 2026
  1. Главная
  2. Блог
  3. Агент выживает дольше, когда направляет внимание на главную нехватку
2 мин чтения

Коротко

В работе по active inference внимание рассматривается как ограниченный ресурс, который нужно направлять не на самый заметный сигнал, а на наиболее дефицитную потребность. В симуляции такой механизм заметно повысил выживаемость и ускорил обучение динамике среды, но пока это результат эксперимента в gridworld, а не доказательство для реальных роботов.

Внимание здесь — не просто фильтр для входящих данных. Это способ решить, какую внутреннюю потребность агент будет оценивать точнее, когда вычислительный и перцептивный бюджет ограничен.

Авторы смоделировали агента-собирателя в AffectWorld — gridworld с четырьмя каналами телесных потребностей. На каждом шаге агент читает свои оценки состояния, выбирает наиболее требующий внимания канал и перераспределяет в его пользу фиксированный бюджет interoceptive precision. Важная деталь: одна и та же «настроенная» модель наблюдений используется и для обновления убеждений, и для планирования действий.

Результат выглядит убедительно для этой постановки. На этапе обучения агент с выборочным распределением precision выжил более чем вдвое чаще, чем агент с равномерным распределением при том же бюджете: 0,414 против 0,199 на 11 конфигурациях, по 32 сида на каждую.

Но сильный вывод работы не в самом числе. Авторы отдельно проверили, откуда берётся преимущество. Если дать изменённую модель наблюдений восприятию, но не планировщику, эффект сокращается примерно наполовину. Значит, селективное внимание помогает не только лучше понять состояние тела, но и выбрать действие на его основе.

Есть и отрицательный контроль: направлять precision на наименее нужный канал хуже, чем распределять её равномерно. Это важное ограничение для разговоров о «внимании» вообще. Дело не в том, чтобы выделять ресурс одному сигналу, а в том, чтобы связывать его с текущим дефицитом.

Дополнительный след механизма виден в скорости обучения. Канал, на который направлено внимание, осваивает собственную динамику примерно вдвое быстрее и сохраняет преимущество даже при одинаковом числе наблюдений. То есть выигрыш проявляется не только в конечной выживаемости, но и в том, как быстро агент строит модель мира.

Практический смысл для разработчиков агентов простой: при ограниченном контексте, количестве сенсоров или вычислительном бюджете полезно маршрутизировать точность по состоянию задачи, а не распределять её равномерно. Причём этот маршрут должен влиять не только на perception, но и на planning.

Однако переносить результат на биологические системы или реальные embodied-агенты пока рано. В источнике показан контролируемый эксперимент в четырёхканальной gridworld; он демонстрирует рабочий механизм, но не универсальность подхода. Следующий серьёзный вопрос — сохранится ли преимущество, когда потребности будут шумными, сенсоры несовершенными, а цена ошибки — не абстрактным снижением survival, а реальным ограничением поведения.

Источник: cs.AI updates on arXiv.org

новостиaiагентынаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​