• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Sayed Essam / Unsplash

MoE можно сжимать, но одинаково по всем слоям — нельзя

Sh0ny
Sh0ny
17 августа 2026
  1. Главная
  2. Блог
  3. MoE можно сжимать, но одинаково по всем слоям — нельзя
2 мин чтения

Коротко

Исследование Qwen3.6-35B-A3B показывает неожиданный перекос: поздние MoE-слои выдерживают агрессивное отключение экспертов, а ранние и средние быстро теряют качество. Это полезный ориентир для сжатия моделей, но пока не универсальный рецепт.

Сжать Mixture-of-Experts можно заметно сильнее, чем кажется, если не трогать модель равномерно. Главный практический вывод исследования: запас прочности у экспертов распределён по глубине, и поздние слои гораздо лучше переносят отключение малозначимых экспертов.

Авторы проверили Qwen3.6-35B-A3B: 40 MoE-слоёв, по 256 экспертов в каждом, с маршрутизацией top-8. Экспертов маскировали по величине их весов и оценивали результат на XLCoST — бенчмарке трансляции кода между языками.

Равномерное маскирование 30% экспертов оставило только 150 из 300 результатов в категориях Good+Similar. Но стратегии, сосредоточенные на поздних слоях, сохранили 249–255 таких результатов, отключив от 640 до 1145 экспертов.

На отдельной проверке из 500 запросов лучшим компромиссом стала ещё более узкая политика: маскирование 50% экспертов в слоях 35–39. Она сохранила 419 результатов Good+Similar, отключив 640 из 10 240 экспертов. Иными словами, вопрос не в том, сколько экспертов удалить, а в том, где именно это сделать.

Авторы также проверили уменьшение числа активных экспертов на токен с восьми до шести. На пробе из 100 запросов это дало заметное сокращение времени выполнения без потери Good+Similar, но вместе с агрессивным маскированием такой подход пока не складывается в надёжную общую стратегию.

Ограничения существенные: исследование проведено на одной модели и одном бенчмарке, а выводы опираются на серии проверок на 100, 300 и 500 запросах. Наблюдаемое сокращение времени не сопровождается точной цифрой в исходном описании. Кроме того, работа пока даёт основу для будущего физического удаления весов, активационного скоринга экспертов и дообучения, а не готовый универсальный инструмент сжатия.

Тем не менее направление выглядит здраво: для MoE разумнее сначала строить карту чувствительности по слоям, а уже потом резать модель. Стандартное «уберём одинаковый процент везде» здесь не просто неоптимально — оно может выбросить качество там, где модель наиболее уязвима.

Если бы вам нужно было сжать MoE-модель для продакшена, вы бы сначала экономили на поздних слоях или потребовали проверку на каждом своём типе задач? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​