Коротко
Новый метод GLIDE показывает, что ранние слои LLM критически зависят от softmax-внимания, а глубокие — нет. Неравномерная замена softmax на линейную рекурренцию снижает задержку без потери качества.
Когда контекст LLM растёт до десятков тысяч токенов, главным узким местом становится не вычисления, а память: KV-кеш раздувается, и I/O-нагрузка при декодировании душит пропускную способность. Стандартный ответ — заменить softmax-внимание на линейную рекурренцию — работает, но режет качество. GLIDE предлагает подход тоньше: не резать везде, а резать выборочно.
Ключевая идея строится на наблюдении, которое авторы называют layer-wise heterogeneity. Ранние слои модели высокочувствительны к удалению softmax: убери его — и модель теряет выразительность, которая компенсируется на поздних слоях с трудом. Глубокие слои, напротив, демонстрируют избыточность и спокойно переносят агрессивную замену на линейную альтернативу. Это не гипотеза, а эмпирический факт, который меняет саму постановку задачи.
GLIDE использует это неравенство. Каждый слой получает адаптивный баланс между линейной рекурренцией и окном softmax переменного размера. Ранние слои сохраняют широкое softmax-окно, глубокие — переходят на линейную агрегацию. В отличие от uniform-гибридов, которые жмут всё одинаково, GLIDE сжимает softmax-след неравномерно по глубине модели, сохраняя выразительность там, где она критична.
Практический результат: end-to-end задержка на длинном контексте снижается без компромисса с качеством. Для тех, кто гоняет LLM на длинных промптах в продакшене, это прямой путь к удешевлению инференса — не за счёт урезания модели, а за счёт умного распределения нагрузки между слоями.
Главный вопрос, который остаётся открытым: насколько этот layer-wise профиль переносится между архитектурами. Если чувствительность слоёв к softmax универсальна, GLIDE становится стандартным приёмом оптимизации. Если нет — каждый новый модельный ряд потребует отдельного профилирования.
Источник: cs.AI updates on arXiv.org