• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Bernard Hermant / Unsplash

85% задержки долой: генеративные рекомендации ускоряются

Sh0ny
Sh0ny
3 августа 2026
  1. Главная
  2. Блог
  3. 85% задержки долой: генеративные рекомендации ускоряются
2 мин чтения

Коротко

Генеративные рекомендации обещают гибкость, но упираются в inference latency. GenCDSR сокращает задержку на 85% и слегка поднимает точность — разберу, какой trade-off за этим стоит.

Генеративные рекомендации — это попытка переформулировать классический ranking в задачу автогрессивной генерации: модель учится не скорить айтемы, а «дописывать» идентификатор следующего товара. Звучит элегантно, но на практике упирается в две стены: токенизация, которая не видит связей между доменами, и beam search, который тормозит inference до непригодности для real-time. arXiv-препринт GenCDSR берётся за обе проблемы сразу — и цифры Reduction выглядят достойно, но с оговорками.

Главная претензия авторов к существующим generative recommendation-методам — они токенизируют айтемы в пределах одного домена и не учитывают, что пользователь, скажем, смотрит фильмы и читает книги, и его интересы между этими доменами коррелируют. GenCDSR предлагает cross-domain hybrid tokenization: multi-tower архитектура с иерархическими shared-specific и fine-grained codebooks, которые одновременно ловят общие паттерны и домен-специфичные различия. По сути — попытка разделить «что общего у доменов» и «что уникально» на уровне кодбуков, а не на уровне фичей.

Вторая часть — decoding. Beam search в генеративных рекомендациях работает медленно, и это блокирует продакшен. Авторы предлагают serial-parallel стратегию: используют иерархическую структуру semantic identifiers, чтобы частично распараллелить генерацию. Детали архитектуры в абстракте не раскрыты, но идея в том, чтобы не жертвовать консистентностью ради скорости.

Результаты на трёх публичных датасетах: средний прирост точности 1.5% и снижение inference latency на 85.1% относительно SOTA-базлайнов. Первый выглядит скромно — 1.5% в рекомендациях часто в пределах шума. Второй — впечатляет: 85% latency reduction — это разница между «работает на бумаге» и «можно ставить в real-time пайплайн». Код и датасеты открыты, что позволяет проверить заявленное на своих данных.

Ключевой trade-off здесь не точность против скорости — прирост точности слишком мал, чтобы ради него менять стек. Реальная ценность в том, что генеративный подход становится deployable. Если раньше GR был исследовательской игрушкой с непредсказуемой задержкой, то теперь появляется архитектурный шаблон, где latency предсказуема и управляема. Вопрос, который остаётся открытым: сохранится ли 85% на более тяжелых доменах и при масштабировании кодбуков — три датасета не дают уверенности, но дают повод проверить.

Источник: cs.AI updates on arXiv.org

новостиaiразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​