• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Petter Lagson / Unsplash

Почему 3D-аватары «жуют» слова и как это исправляет PD-GS

Sh0ny
Sh0ny
7 августа 2026
  1. Главная
  2. Блог
  3. Почему 3D-аватары «жуют» слова и как это исправляет PD-GS
1 мин чтения

Коротко

Плавное движение губ не всегда выглядит естественно: при попытке предсказать артикуляцию по аудио модель усредняет короткие, но важные движения. PD-GS добавляет в этот процесс выровненные по времени фонемы и заметно лучше сохраняет смыкания губ.

У 3D-аватаров проблема часто не в общей синхронизации с речью, а в конкретных звуках. Модель может красиво двигать губами, но не закрыть их там, где произносится «п», «б» или «м». В итоге получается эффект leaky mouth — рот будто слегка приоткрыт даже в момент явного смыкания.

Причина довольно практичная: аудио — непрерывный сигнал, а артикуляция содержит короткие дискретные события. Если учить модель напрямую восстанавливать движение губ по акустическому представлению, она склонна выбирать усреднённую конфигурацию. Для плавной анимации это удобно, но для согласных разрушает смысл произнесённого.

PD-GS добавляет к аудио временно выровненные фонемы. Их получают через автоматическое распознавание речи и forced alignment — процедуру, которая определяет, в какой момент звучит каждый фонетический элемент. Затем Linguistic Fusion Module решает, чему доверять сильнее: непрерывному аудиоконтексту или дискретной фонеме. На обычных участках сохраняется плавность, а в артикуляционно критических модель получает более жёсткую подсказку.

Это важный компромисс: авторы не заменяют аудио фонемами, а используют фонемы как корректирующий сигнал. Благодаря этому PD-GS получил лучший показатель геометрии губ среди сравниваемых методов на HDTF — LMD 2.66 — и качественно уменьшил нарушения смыкания в сложных последовательностях фонем.

Но решение не магическое. Качество зависит от отдельного ASR и forced-alignment конвейера, а значит, ошибки распознавания или выравнивания могут попасть прямо в анимацию. Кроме того, метод обучается по монокулярному видео с реконструкцией изображения и разметкой ключевых точек губ; в источнике нет данных о цене, доступности готовой реализации или сравнении с более широким набором условий. Поэтому главный результат здесь не «аватар наконец понимает речь», а более узкий и полезный вывод: для правдоподобных губ одной акустики недостаточно — нужны явные языковые ограничения.

Если выбирать между полностью плавной аудиореактивной анимацией и системой, которая иногда зависит от ошибок распознавания, что для вашего проекта важнее: визуальная мягкость или точное смыкание губ? Источник: cs.AI updates on arXiv.org

новостиaiнейросетиразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​