Коротко
EntropyMoE связывает два механизма, которые обычно развиваются отдельно: динамическую группировку байтов и выбор экспертов в Mixture-of-Experts. Это может сделать вычисления гибче, но само по себе ещё не доказывает ускорение или снижение стоимости модели.
В tokenizer-free LLM модель может обрабатывать не готовые токены, а динамические группы байтов — патчи. Проблема в том, что дальше каждый такой патч получает одинаковый объём вычислений, хотя его смысл и размер могут сильно различаться.
EntropyMoE предлагает использовать уже имеющийся сигнал — энтропию патча — для маршрутизации в Top-K experts. Проще говоря, модель сначала группирует байты, а затем по той же характеристике решает, каким экспертам отправить получившийся фрагмент.
Важная деталь: маршрутизация учитывает не только энтропию, но и длину патча. А вклад в учёт нагрузки определяется покрытием байтов. Это выглядит разумнее, чем считать каждый фрагмент одинаковой единицей работы: длинный патч действительно может представлять больший объём входа.
По данным авторов, EntropyMoE показала самый низкий held-out bits-per-byte среди сопоставимых dense- и sparse-моделей, сохранив близкую точность на последующих задачах. Но главный результат здесь не в обещании «MoE стало быстрее», а в другом: энтропия патча может быть координатой для условных вычислений даже без классической токенизации.
Есть и ограничение, о котором легко забыть в пересказе. В аннотации нет конкретных данных о реальном ускорении, стоимости инференса, размере моделей или выигрыше на железе. Поэтому пока корректнее говорить о более удачном распределении вычислений и качестве предсказания, а не о доказанном практическом сокращении расходов.
Если выбирать между более сложной маршрутизацией и простой одинаковой обработкой всех фрагментов, что для вас важнее: лучшее качество при той же архитектурной сложности или подтверждённая экономия времени и денег на продакшене? Источник: cs.AI updates on arXiv.org