Коротко
Исследование Whisper на персидской речи показывает неожиданный практический приоритет: PCA-сжатие признаков дало более заметную пользу, чем адаптация модели под язык. Это снижает требования к памяти и ускоряет обучение, но не решает проблему ограниченных данных.
В распознавании эмоций в персидской речи есть неприятный конфликт: большая предобученная модель не гарантирует, что её языковая адаптация хорошо перенесётся на эмоции. В исследовании Whisper дообучали на персидском ASR, но основной выигрыш пришёл не от этого.
Авторы брали покадровые представления из encoder Whisper и сжимали их с помощью PCA. Это позволило отказаться от обучаемых projection layers, уменьшить число параметров, а также снизить задержку обучения и расход памяти. После сжатия признаки объединялись attention-механизмом и передавались в лёгкую классификационную голову.
На датасете ShEMO с проверкой на независимых от обучения дикторах PCA стабильно улучшала распознавание эмоций. А вот fine-tuning Whisper под персидское распознавание речи дал лишь скромный прирост.
Практический вывод здесь важнее самого результата на одном датасете: перед дорогой языковой адаптацией стоит проверить, не мешает ли задаче избыточная размерность признаков. Для небольшого набора размеченных данных компактное представление может оказаться полезнее, чем ещё один этап дообучения большой модели.
Ограничения у вывода существенные. Исследование проверяли на одном наборе ShEMO и в конкретных условиях эксперимента; численные результаты в доступном описании не приведены. Поэтому нельзя считать доказанным, что PCA всегда лучше fine-tuning или что языковая адаптация бесполезна для других языков, моделей и корпусов.
Если бы вы собирали такую систему с небольшим датасетом, что проверили бы первым: адаптацию Whisper под язык или уменьшение размерности его признаков?
Источник: cs.CL updates on arXiv.org