• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Mohammad Rahmani / Unsplash

MIDAS учит модель не угадывать пропавшие модальности, а снижать им доверие

Sh0ny
Sh0ny
12 августа 2026
  1. Главная
  2. Блог
  3. MIDAS учит модель не угадывать пропавшие модальности, а снижать им доверие
2 мин чтения

Коротко

В мультимодальном анализе тональности проблема не только в отсутствии текста, аудио или видео, но и в том, что модель может слишком уверенно опереться на испорченный сигнал. MIDAS предлагает разделять общую и специфичную информацию модальностей и учитывать неопределённость при их объединении.

Когда у модели пропадает часть входных данных — например, нет аудио или видео, — она часто пытается восстановить недостающее или компенсировать его эвристикой. Но для анализа тональности важнее сначала понять, каким оставшимся сигналам вообще можно доверять.

Именно на этом построен MIDAS — метод для мультимодального анализа тональности при неполных данных. Его главный ход не в том, чтобы любой ценой «дорисовать» отсутствующую модальность, а в том, чтобы разложить представление каждой модальности на две части: общую для всех сигналов и специфичную только для неё.

Общая часть должна сохранять смысл, который согласуется между модальностями. Специфичная — особенности текста, аудио или видео, которые не обязаны совпадать. MIDAS специально уменьшает взаимную информацию между этими пространствами, чтобы они меньше смешивались, и одновременно усиливает согласованность общих частей.

Дальше в дело вступает неопределённость. Метод представляет признаки как латентные переменные с распределением, а дисперсию использует как оценку надёжности: чем менее уверенна модель в сигнале, тем меньше его влияние при слиянии. Это практичнее, чем считать все доступные модальности одинаково полезными.

В этом и заключается полезный вывод: устойчивый мультимодальный AI — не обязательно тот, который умеет восстановить всё потерянное. Иногда лучше честно уменьшить вес сомнительного сигнала и опереться на то, что осталось. Авторы сообщают о результатах на трёх распространённых датасетах и улучшении относительно базовых методов в разных сценариях неполных данных.

Но есть важные ограничения. В представленном описании нет конкретных чисел улучшения, названий датасетов и подробностей о вычислительной стоимости метода. Поэтому по одному abstract нельзя понять, насколько MIDAS лучше на каждом типе пропусков и как он поведёт себя в реальных потоках с шумными или испорченными данными, а не только в экспериментальных настройках.

Если выбирать для своего AI одну идею из этой работы, я бы взял не сложную формулу взаимной информации, а принцип: отсутствие сигнала и ненадёжный сигнал — не одно и то же. В ваших проектах модель чаще страдает от нехватки данных или от слишком уверенного доверия к плохим данным?

Источник: cs.AI updates on arXiv.org

новостиaiнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​