• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Jeanson Wong / Unsplash

Почему веса маршрутизации не объясняют решения MoE-модели

Sh0ny
Sh0ny
10 августа 2026
  1. Главная
  2. Блог
  3. Почему веса маршрутизации не объясняют решения MoE-модели
1 мин чтения

Коротко

В Mixture-of-Experts важно знать не только, к какому эксперту попал запрос, но и почему он предпочёл один ответ другому. Разбор CoCo показывает, как интерпретировать такие решения на уровне пар ответов, а не по косвенным сигналам маршрутизатора.

Узнать, какой эксперт получил запрос, ещё не значит понять, как он его оценил. Для разреженных Mixture-of-Experts reward models это принципиальная проблема: веса маршрутизации показывают, какие примеры эксперт принимает, но не объясняют, почему один ответ он считает лучше другого.

Авторы предлагают смотреть на поведение эксперта через пары выбранный–отклонённый ответ. Метод Contribution-Contrast, или CoCo, ищет пары, где разница во вкладе эксперта особенно велика. Так интерпретация связывает сразу две вещи: к каким запросам эксперт подключается и какие признаки ответа влияют на его предпочтение.

Это важнее, чем просто собрать примеры с максимальным routing weight. Такой список может описать область работы эксперта, но легко пропустить его реальные критерии оценки. Например, эксперт может получать запросы из одной тематики, а различать ответы по совершенно другой особенности — полноте, стилю или следованию инструкции. В абстракте не раскрыто, какие именно паттерны нашли авторы, но сама постановка проблемы выглядит убедительно.

По заявлению авторов, CoCo показал более связные, верные и специализированные интерпретации, чем подходы на основе маршрутизатора, итоговых оценок и sparse autoencoder. При этом точность reward model осталась на конкурентном уровне. То есть интерпретируемость здесь не предлагается в обмен на качество предсказаний.

Есть и ограничения. Это работа на arXiv, а в исходном описании нет численных результатов, подробностей экспериментов или примеров найденных интерпретаций. Поэтому пока нельзя оценить, насколько большой практический выигрыш даёт CoCo и насколько хорошо метод переносится на другие MoE reward models. Самый полезный вывод осторожнее: для понимания таких моделей одного маршрутизатора недостаточно, нужны данные о том, как эксперт сравнивает ответы.

Если вы проверяете работу reward model, вам важнее знать, какие запросы получает эксперт, или какие конкретные различия между ответами меняют его оценку? Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​