Коротко
Генеративные рекомендации обещают гибкость, но упираются в inference latency. GenCDSR сокращает задержку на 85% и слегка поднимает точность — разберу, какой trade-off за этим стоит.
Генеративные рекомендации — это попытка переформулировать классический ranking в задачу автогрессивной генерации: модель учится не скорить айтемы, а «дописывать» идентификатор следующего товара. Звучит элегантно, но на практике упирается в две стены: токенизация, которая не видит связей между доменами, и beam search, который тормозит inference до непригодности для real-time. arXiv-препринт GenCDSR берётся за обе проблемы сразу — и цифры Reduction выглядят достойно, но с оговорками.
Главная претензия авторов к существующим generative recommendation-методам — они токенизируют айтемы в пределах одного домена и не учитывают, что пользователь, скажем, смотрит фильмы и читает книги, и его интересы между этими доменами коррелируют. GenCDSR предлагает cross-domain hybrid tokenization: multi-tower архитектура с иерархическими shared-specific и fine-grained codebooks, которые одновременно ловят общие паттерны и домен-специфичные различия. По сути — попытка разделить «что общего у доменов» и «что уникально» на уровне кодбуков, а не на уровне фичей.
Вторая часть — decoding. Beam search в генеративных рекомендациях работает медленно, и это блокирует продакшен. Авторы предлагают serial-parallel стратегию: используют иерархическую структуру semantic identifiers, чтобы частично распараллелить генерацию. Детали архитектуры в абстракте не раскрыты, но идея в том, чтобы не жертвовать консистентностью ради скорости.
Результаты на трёх публичных датасетах: средний прирост точности 1.5% и снижение inference latency на 85.1% относительно SOTA-базлайнов. Первый выглядит скромно — 1.5% в рекомендациях часто в пределах шума. Второй — впечатляет: 85% latency reduction — это разница между «работает на бумаге» и «можно ставить в real-time пайплайн». Код и датасеты открыты, что позволяет проверить заявленное на своих данных.
Ключевой trade-off здесь не точность против скорости — прирост точности слишком мал, чтобы ради него менять стек. Реальная ценность в том, что генеративный подход становится deployable. Если раньше GR был исследовательской игрушкой с непредсказуемой задержкой, то теперь появляется архитектурный шаблон, где latency предсказуема и управляема. Вопрос, который остаётся открытым: сохранится ли 85% на более тяжелых доменах и при масштабировании кодбуков — три датасета не дают уверенности, но дают повод проверить.
Источник: cs.AI updates on arXiv.org