• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Shruti Singh / Unsplash

Не все слои LLM одинаковы: GLIDE сжимает KV-кеш там, где это безопасно

Sh0ny
Sh0ny
30 июля 2026
  1. Главная
  2. Блог
  3. Не все слои LLM одинаковы: GLIDE сжимает KV-кеш там, где это безопасно
1 мин чтения

Коротко

Новый метод GLIDE показывает, что ранние слои LLM критически зависят от softmax-внимания, а глубокие — нет. Неравномерная замена softmax на линейную рекурренцию снижает задержку без потери качества.

Когда контекст LLM растёт до десятков тысяч токенов, главным узким местом становится не вычисления, а память: KV-кеш раздувается, и I/O-нагрузка при декодировании душит пропускную способность. Стандартный ответ — заменить softmax-внимание на линейную рекурренцию — работает, но режет качество. GLIDE предлагает подход тоньше: не резать везде, а резать выборочно.

Ключевая идея строится на наблюдении, которое авторы называют layer-wise heterogeneity. Ранние слои модели высокочувствительны к удалению softmax: убери его — и модель теряет выразительность, которая компенсируется на поздних слоях с трудом. Глубокие слои, напротив, демонстрируют избыточность и спокойно переносят агрессивную замену на линейную альтернативу. Это не гипотеза, а эмпирический факт, который меняет саму постановку задачи.

GLIDE использует это неравенство. Каждый слой получает адаптивный баланс между линейной рекурренцией и окном softmax переменного размера. Ранние слои сохраняют широкое softmax-окно, глубокие — переходят на линейную агрегацию. В отличие от uniform-гибридов, которые жмут всё одинаково, GLIDE сжимает softmax-след неравномерно по глубине модели, сохраняя выразительность там, где она критична.

Практический результат: end-to-end задержка на длинном контексте снижается без компромисса с качеством. Для тех, кто гоняет LLM на длинных промптах в продакшене, это прямой путь к удешевлению инференса — не за счёт урезания модели, а за счёт умного распределения нагрузки между слоями.

Главный вопрос, который остаётся открытым: насколько этот layer-wise профиль переносится между архитектурами. Если чувствительность слоёв к softmax универсальна, GLIDE становится стандартным приёмом оптимизации. Если нет — каждый новый модельный ряд потребует отдельного профилирования.

Источник: cs.AI updates on arXiv.org

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​