Коротко
Диффузионные языковые модели перспективны, но тормозят из-за консервативных порогов уверенности при декодинге. Фреймворк DC-Leap решает проблему без переобучения, ускоряя генерацию до 105 раз с сохранением качества.
Диффузионные языковые модели (dLLMs) — это нишевая, но любопытная альтернатива привычным авторегрессионным LLM. На практике они часто упираются в медленный параллельный декодинг. Проблема кроется в ошибке зависимости совместных вероятностей (Joint Probability Dependence Error, JPDE): из-за неё приходится ставить слишком консервативные пороги уверенности. Это приводит к лишним итерациям денойзинга и падению скорости генерации.
Исследователи предложили DC-Leap — фреймворк, который ускоряет dLLMs без необходимости переобучения. Решение строится на двух механизмах. Первый, Dynamic Contiguous Verification, внедряет строго упорядоченные причинные ограничения в процесс параллельного декодинга. Это позволяет постепенно валидировать зависимости токенов и эффективно нейтрализовать JPDE. Второй механизм — draft-guided decoding: черновик помогает расширить контекст, перепрыгивая через несколько токенов вперёд, что сохраняет структурные преимущества двунаправленного внимания во время инференса.
Результаты на стандартных бенчмарках выглядят впечатляюще. Для генерации длинных последовательностей на MBPP ускорение достигает 53.19x. В комбинации с KV-Cache фреймворк выдаёт ускорение до 105.02x. Важно, что качество генерации при этом остаётся сопоставимым с базовым подходом.
Если заявленные цифры подтвердятся на реальных продакшен-задачах, dLLMs станут гораздо более привлекательным выбором для разработчиков. Код фреймворка уже доступен в открытом репозитории.
Источник: cs.AI updates on arXiv.org