• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Arkan Perdana / Unsplash

MLLM ускорили в 3,09 раза, оставив 5,56% визуальных токенов

Sh0ny
Sh0ny
10 августа 2026
  1. Главная
  2. Блог
  3. MLLM ускорили в 3,09 раза, оставив 5,56% визуальных токенов
1 мин чтения

Коротко

Исследователи научили мультимодальную модель заранее оценивать, какие части изображения нужны для ответа, и отбрасывать остальные ещё до запуска языковых слоёв. На LLaVA-NeXT-7B это сохранило 97,5% исходного качества, но результат пока нельзя автоматически переносить на любые модели и задачи.

Главное здесь не то, что у MLLM снова появился способ pruning. Важнее момент, когда он происходит: система отбрасывает ненужные визуальные токены ещё до первого языкового слоя, а не после нескольких дорогих проходов, когда часть вычислений уже потрачена.

В обычном подходе модель смотрит на attention в заранее выбранном среднем слое и по нему решает, какие фрагменты изображения оставить. Но один и тот же слой не одинаково полезен для разных вопросов. Для одного изображения нужный сигнал появляется раньше, для другого — позже.

Метод MAP решает обе проблемы сразу. Во время обучения он сравнивает attention для исходного и контрольного вопроса, выбирает подходящий для конкретного примера слой и передаёт его поведение лёгкому предиктору. При работе модели этот предиктор оценивает важность визуальных токенов по мультимодальным признакам — без построения attention-карт.

На десяти бенчмарках для LLaVA-NeXT-7B MAP оставил только 5,56% визуальных токенов, сохранив 97,5% качества модели без pruning. Сквозное ускорение составило 3,09 раза. Практический смысл очевиден: экономия возникает не за счёт более быстрого анализа большого числа токенов, а за счёт того, что большая часть из них вообще не доходит до тяжёлых слоёв.

Но есть важные ограничения. Все приведённые цифры относятся к LLaVA-NeXT-7B и десяти бенчмаркам — в источнике нет данных о других архитектурах, реальных пользовательских запросах или стоимости обучения предиктора. Кроме того, метод всё равно должен правильно оценить важность токенов: ошибка на раннем этапе уже не исправится последующими слоями. Поэтому это не универсальное доказательство, что любую MLLM можно безболезненно ускорить в 3,09 раза, а хорошо очерченный результат для конкретной модели и режима тестирования.

Если бы вам пришлось выбирать, что важнее для такого ускорения: потеря 2,5% качества или риск пропустить небольшой, но критичный фрагмент изображения?

Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​