Коротко
ReMem показывает, что узкое место long-video QA — не容量 модели, а равномерная выборка кадров. Адаптивный подход без обучения даёт двузначный прирост на бенчмарках.
Контекстное окно — не главная проблема для long-video QA. Главная — то, как модели выбирают кадры из длинного видео. Равномерная выборка и статический отбор пропускают временной контекст, который критичен для ответа на конкретный вопрос. ReMem — фреймворк без обучения, который закрывает этот пробел через двухуровневую адаптацию памяти и поднимает точность LLaVA-Video на LVBench с 42.2% до 54.5%.
Подход работает на двух уровнях. На уровне запроса LLM-память разбирает временную гранулярность вопроса и извлекает семантические сущности — то есть понимает, какой именно отрезок видео важен. На уровне видео структурная память выравнивает кадры с семантикой запроса и динамически распределяет бюджет выборки по кластерам событий. Вместо того чтобы брать кадры через равные промежутки, ReMem концентрирует выборку там, где происходит релевантное действие.
Результаты на четырёх бенчмарках LongVideoQA с тремя MLLM показывают state-of-the-art в zero-shot режиме. LLaVA-Video с ReMem достигает 67.1% (+8.2%) на LongVideoBench. Прирост без дообучения — аргумент в пользу того, что инфраструктура выборки данных важнее сырой ёмкости модели. Если ваш пайплайн обработки видео всё ещё использует равномерный сэмплинг, это первое, что стоит пересмотреть.
Источник: cs.AI updates on arXiv.org