In short
The new test checks not recognition of a picture or a sound but the ability to reconstruct an unseen result from hand movement and the sound of the pen. People scored above 80% accuracy, while GPT-4o and Gemini 2.5-Pro did not clear 10% — and combining audio with video often made the answer worse.
Мультимодальные модели уверенно распознают то, что им показали. Но если нужно понять, что происходило за пределами видимого, их уверенность быстро заканчивается.
В The Unwritten Benchmark слово нельзя прочитать глазами: чернила убраны. Модель получает только видео движений руки и аудио царапания пера по поверхности. Нужно восстановить написанное слово, причём в трёх разных стилях письма.
Это важное отличие от обычного теста на зрение или слух. Здесь недостаточно заметить отдельные признаки — скорость движения, направление штриха, звук пера. Нужно собрать их в скрытую последовательность и понять причинную связь: какое движение и какой звук соответствуют конкретной букве.
Результат оказался жёстким. Люди показали точность упорядоченного распознавания букв выше 80%, а ведущие мультимодальные модели, включая GPT-4o и Gemini 2.5-Pro, не смогли превысить 10%.
Самая неожиданная часть — добавление второго канала не помогло. В ряде случаев совместная подача видео и аудио ухудшала результат по сравнению с использованием одной модальности. Похоже, модели не умеют надёжно синтезировать взаимодополняющие сигналы, когда ответ нужно вывести из динамического процесса, а не найти в готовом изображении.
Ограничения исследования тоже важны: работа проверяет одну конкретную задачу — восстановление слов по микродвижениям руки и звуку пера. Поэтому результат нельзя напрямую превращать в вывод о бесполезности мультимодальных моделей вообще. Но он показывает уязвимое место: распознавать наблюдаемое и рассуждать о невидимой причине — разные способности.
Если модель может одновременно видеть движение и слышать его, но от этого чаще ошибается, стоит ли считать её по-настоящему мультимодальной? Источник: cs.AI updates on arXiv.org