• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Alexandar Todov / Unsplash

MoE без токенизатора: энтропия байтов решает, кому считать патч

Sh0ny
Sh0ny
10 августа 2026
  1. Главная
  2. Блог
  3. MoE без токенизатора: энтропия байтов решает, кому считать патч
1 мин чтения

Коротко

EntropyMoE связывает два механизма, которые обычно развиваются отдельно: динамическую группировку байтов и выбор экспертов в Mixture-of-Experts. Это может сделать вычисления гибче, но само по себе ещё не доказывает ускорение или снижение стоимости модели.

В tokenizer-free LLM модель может обрабатывать не готовые токены, а динамические группы байтов — патчи. Проблема в том, что дальше каждый такой патч получает одинаковый объём вычислений, хотя его смысл и размер могут сильно различаться.

EntropyMoE предлагает использовать уже имеющийся сигнал — энтропию патча — для маршрутизации в Top-K experts. Проще говоря, модель сначала группирует байты, а затем по той же характеристике решает, каким экспертам отправить получившийся фрагмент.

Важная деталь: маршрутизация учитывает не только энтропию, но и длину патча. А вклад в учёт нагрузки определяется покрытием байтов. Это выглядит разумнее, чем считать каждый фрагмент одинаковой единицей работы: длинный патч действительно может представлять больший объём входа.

По данным авторов, EntropyMoE показала самый низкий held-out bits-per-byte среди сопоставимых dense- и sparse-моделей, сохранив близкую точность на последующих задачах. Но главный результат здесь не в обещании «MoE стало быстрее», а в другом: энтропия патча может быть координатой для условных вычислений даже без классической токенизации.

Есть и ограничение, о котором легко забыть в пересказе. В аннотации нет конкретных данных о реальном ускорении, стоимости инференса, размере моделей или выигрыше на железе. Поэтому пока корректнее говорить о более удачном распределении вычислений и качестве предсказания, а не о доказанном практическом сокращении расходов.

Если выбирать между более сложной маршрутизацией и простой одинаковой обработкой всех фрагментов, что для вас важнее: лучшее качество при той же архитектурной сложности или подтверждённая экономия времени и денег на продакшене? Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​