Коротко
Исследователи научили мультимодальную модель заранее оценивать, какие части изображения нужны для ответа, и отбрасывать остальные ещё до запуска языковых слоёв. На LLaVA-NeXT-7B это сохранило 97,5% исходного качества, но результат пока нельзя автоматически переносить на любые модели и задачи.
Главное здесь не то, что у MLLM снова появился способ pruning. Важнее момент, когда он происходит: система отбрасывает ненужные визуальные токены ещё до первого языкового слоя, а не после нескольких дорогих проходов, когда часть вычислений уже потрачена.
В обычном подходе модель смотрит на attention в заранее выбранном среднем слое и по нему решает, какие фрагменты изображения оставить. Но один и тот же слой не одинаково полезен для разных вопросов. Для одного изображения нужный сигнал появляется раньше, для другого — позже.
Метод MAP решает обе проблемы сразу. Во время обучения он сравнивает attention для исходного и контрольного вопроса, выбирает подходящий для конкретного примера слой и передаёт его поведение лёгкому предиктору. При работе модели этот предиктор оценивает важность визуальных токенов по мультимодальным признакам — без построения attention-карт.
На десяти бенчмарках для LLaVA-NeXT-7B MAP оставил только 5,56% визуальных токенов, сохранив 97,5% качества модели без pruning. Сквозное ускорение составило 3,09 раза. Практический смысл очевиден: экономия возникает не за счёт более быстрого анализа большого числа токенов, а за счёт того, что большая часть из них вообще не доходит до тяжёлых слоёв.
Но есть важные ограничения. Все приведённые цифры относятся к LLaVA-NeXT-7B и десяти бенчмаркам — в источнике нет данных о других архитектурах, реальных пользовательских запросах или стоимости обучения предиктора. Кроме того, метод всё равно должен правильно оценить важность токенов: ошибка на раннем этапе уже не исправится последующими слоями. Поэтому это не универсальное доказательство, что любую MLLM можно безболезненно ускорить в 3,09 раза, а хорошо очерченный результат для конкретной модели и режима тестирования.
Если бы вам пришлось выбирать, что важнее для такого ускорения: потеря 2,5% качества или риск пропустить небольшой, но критичный фрагмент изображения?
Источник: cs.AI updates on arXiv.org