• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Cristian Pineda / Unsplash

Когда два канала восприятия делают ИИ хуже, а не лучше

Sh0ny
Sh0ny
18 августа 2026
  1. Главная
  2. Блог
  3. Когда два канала восприятия делают ИИ хуже, а не лучше
1 мин чтения

Коротко

Новый тест проверяет не распознавание картинки или звука, а способность восстановить невидимый результат по движению руки и звуку пера. Люди набрали больше 80% точности, тогда как GPT-4o и Gemini 2.5-Pro не преодолели 10%, причём объединение аудио и видео часто ухудшало ответ.

Мультимодальные модели уверенно распознают то, что им показали. Но если нужно понять, что происходило за пределами видимого, их уверенность быстро заканчивается.

В The Unwritten Benchmark слово нельзя прочитать глазами: чернила убраны. Модель получает только видео движений руки и аудио царапания пера по поверхности. Нужно восстановить написанное слово, причём в трёх разных стилях письма.

Это важное отличие от обычного теста на зрение или слух. Здесь недостаточно заметить отдельные признаки — скорость движения, направление штриха, звук пера. Нужно собрать их в скрытую последовательность и понять причинную связь: какое движение и какой звук соответствуют конкретной букве.

Результат оказался жёстким. Люди показали точность упорядоченного распознавания букв выше 80%, а ведущие мультимодальные модели, включая GPT-4o и Gemini 2.5-Pro, не смогли превысить 10%.

Самая неожиданная часть — добавление второго канала не помогло. В ряде случаев совместная подача видео и аудио ухудшала результат по сравнению с использованием одной модальности. Похоже, модели не умеют надёжно синтезировать взаимодополняющие сигналы, когда ответ нужно вывести из динамического процесса, а не найти в готовом изображении.

Ограничения исследования тоже важны: работа проверяет одну конкретную задачу — восстановление слов по микродвижениям руки и звуку пера. Поэтому результат нельзя напрямую превращать в вывод о бесполезности мультимодальных моделей вообще. Но он показывает уязвимое место: распознавать наблюдаемое и рассуждать о невидимой причине — разные способности.

Если модель может одновременно видеть движение и слышать его, но от этого чаще ошибается, стоит ли считать её по-настоящему мультимодальной? Источник: cs.AI updates on arXiv.org

новостиaiнейросетиllm
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​