Коротко
В мультимодальных моделях один и тот же механизм позиционного кодирования может путать разные изображения и считать текст, картинку и видео одинаковыми шагами. RIG-RoPE предлагает учитывать не только координаты токена, но и его визуальный экземпляр и информационную длительность — пока без доказательства превосходства на практике.
Мультимодальная модель может ошибаться не потому, что ей не хватило контекста, а потому что она неправильно поняла отношения внутри него. Для текста, изображения и видео нельзя бездумно использовать одну и ту же схему координат: у них разная геометрия и разная плотность информации.
В M-RoPE позиционные каналы обычно разделяются на временные, высотные и широтные. Но если в последовательности рядом стоят токены от разных изображений или визуальных объектов, их пространственное смещение не всегда имеет смысл.
Применять H/W-поворот к такой паре — значит фактически придумывать геометрию там, где её нет. RIG-RoPE предлагает учитывать идентификатор визуального экземпляра: пространственные вращения включаются только для токенов одного изображения или объекта. Для остальных пар неизвестное смещение не принимается за нулевое, а исключается из расчёта.
Вторая идея ещё практичнее. Обычный счётчик позиций двигается на один шаг за токеном, блоком изображения или сегментом видео. Но один текстовый токен, картинка и несколько видеокадров несут совершенно разный объём информации.
В RIG-RoPE временная координата накапливается с учётом длительности блока: текст получает единичный шаг, изображение — масштаб, зависящий от его пространственного размера, а видео — дополнительное логарифмическое расширение с учётом эффективного числа кадров. Это не делает модель «понимающей время», но хотя бы убирает ложное предположение, что все модальности идут с одинаковой скоростью.
RIG-RoPE не добавляет обучаемых параметров. Авторы описывают реализацию через дополнительную метаинформацию на токен — модальность, визуальный идентификатор и координату длительности — так что механизм можно встроить в tiled attention kernels с постоянными накладными данными.
То есть предложение интересно не как новая тяжёлая надстройка, а как попытка исправить саму логику позиционных признаков. Модель не обязана учить отдельные параметры для каждого типа пространственной связи: часть явно неверных связей можно не задавать уже на уровне кодирования.
Работа остаётся предварительным отчётом и прямо не заявляет эмпирического превосходства. В ней представлены формулировка метода, аргумент о неизменности при смене системы координат, результат о невозможности корректно использовать статические идентификаторы в общих H/W-подпространствах и обоснование длительностного подхода — но не подтверждённый практический отрыв на тестах.
Открытый вопрос поэтому не в том, выглядит ли идея разумной, а в том, насколько она помогает реальным мультимодальным моделям: не ухудшит ли она полезные связи между разными экземплярами, как выбирать эффективную длительность и даст ли это заметный результат после обучения.
Если вы проектируете мультимодальную модель, что для неё опаснее: выдуманная связь между объектами или одинаковый «шаг времени» для текста, изображения и видео? Источник: cs.CL updates on arXiv.org