Коротко
Новый тест проверяет не распознавание картинки или звука, а способность восстановить невидимый результат по движению руки и звуку пера. Люди набрали больше 80% точности, тогда как GPT-4o и Gemini 2.5-Pro не преодолели 10%, причём объединение аудио и видео часто ухудшало ответ.
Мультимодальные модели уверенно распознают то, что им показали. Но если нужно понять, что происходило за пределами видимого, их уверенность быстро заканчивается.
В The Unwritten Benchmark слово нельзя прочитать глазами: чернила убраны. Модель получает только видео движений руки и аудио царапания пера по поверхности. Нужно восстановить написанное слово, причём в трёх разных стилях письма.
Это важное отличие от обычного теста на зрение или слух. Здесь недостаточно заметить отдельные признаки — скорость движения, направление штриха, звук пера. Нужно собрать их в скрытую последовательность и понять причинную связь: какое движение и какой звук соответствуют конкретной букве.
Результат оказался жёстким. Люди показали точность упорядоченного распознавания букв выше 80%, а ведущие мультимодальные модели, включая GPT-4o и Gemini 2.5-Pro, не смогли превысить 10%.
Самая неожиданная часть — добавление второго канала не помогло. В ряде случаев совместная подача видео и аудио ухудшала результат по сравнению с использованием одной модальности. Похоже, модели не умеют надёжно синтезировать взаимодополняющие сигналы, когда ответ нужно вывести из динамического процесса, а не найти в готовом изображении.
Ограничения исследования тоже важны: работа проверяет одну конкретную задачу — восстановление слов по микродвижениям руки и звуку пера. Поэтому результат нельзя напрямую превращать в вывод о бесполезности мультимодальных моделей вообще. Но он показывает уязвимое место: распознавать наблюдаемое и рассуждать о невидимой причине — разные способности.
Если модель может одновременно видеть движение и слышать его, но от этого чаще ошибается, стоит ли считать её по-настоящему мультимодальной? Источник: cs.AI updates on arXiv.org