Коротко
Исследование Qwen3.6-35B-A3B показывает неожиданный перекос: поздние MoE-слои выдерживают агрессивное отключение экспертов, а ранние и средние быстро теряют качество. Это полезный ориентир для сжатия моделей, но пока не универсальный рецепт.
Сжать Mixture-of-Experts можно заметно сильнее, чем кажется, если не трогать модель равномерно. Главный практический вывод исследования: запас прочности у экспертов распределён по глубине, и поздние слои гораздо лучше переносят отключение малозначимых экспертов.
Авторы проверили Qwen3.6-35B-A3B: 40 MoE-слоёв, по 256 экспертов в каждом, с маршрутизацией top-8. Экспертов маскировали по величине их весов и оценивали результат на XLCoST — бенчмарке трансляции кода между языками.
Равномерное маскирование 30% экспертов оставило только 150 из 300 результатов в категориях Good+Similar. Но стратегии, сосредоточенные на поздних слоях, сохранили 249–255 таких результатов, отключив от 640 до 1145 экспертов.
На отдельной проверке из 500 запросов лучшим компромиссом стала ещё более узкая политика: маскирование 50% экспертов в слоях 35–39. Она сохранила 419 результатов Good+Similar, отключив 640 из 10 240 экспертов. Иными словами, вопрос не в том, сколько экспертов удалить, а в том, где именно это сделать.
Авторы также проверили уменьшение числа активных экспертов на токен с восьми до шести. На пробе из 100 запросов это дало заметное сокращение времени выполнения без потери Good+Similar, но вместе с агрессивным маскированием такой подход пока не складывается в надёжную общую стратегию.
Ограничения существенные: исследование проведено на одной модели и одном бенчмарке, а выводы опираются на серии проверок на 100, 300 и 500 запросах. Наблюдаемое сокращение времени не сопровождается точной цифрой в исходном описании. Кроме того, работа пока даёт основу для будущего физического удаления весов, активационного скоринга экспертов и дообучения, а не готовый универсальный инструмент сжатия.
Тем не менее направление выглядит здраво: для MoE разумнее сначала строить карту чувствительности по слоям, а уже потом резать модель. Стандартное «уберём одинаковый процент везде» здесь не просто неоптимально — оно может выбросить качество там, где модель наиболее уязвима.
Если бы вам нужно было сжать MoE-модель для продакшена, вы бы сначала экономили на поздних слоях или потребовали проверку на каждом своём типе задач? Источник: cs.AI updates on arXiv.org