Коротко
В Agens Volundr 32B Preview KV-кэш хранится только в 18 из 72 слоёв, что помогает работать с длинным контекстом. Но выигрыш в памяти приходится оценивать вместе с отставанием в агентных тестах и необходимостью запускать модель на специальной сборке.
У Agens Volundr 32B Preview странный компромисс: KV-кэш есть только у 18 из 72 слоёв, зато заявленное окно контекста доходит до 262 тысяч токенов. Если запускаете модели на своём железе, это может помочь уместить длинный контекст в доступную память.
Остальные слои работают на линейном внимании с состоянием фиксированного размера или на сжатом разреженном внимании. По замерам команды, на двух GPU по 48 ГБ скорость генерации в BF16 держится около 24 токенов в секунду, и это стабильно от 8K до 128K контекста. Причём это цифры самих разработчиков, независимых тестов пока нет.
В одних бенчмарках модель обходит Qwen3.8-27B, в других примерно на одном уровне. Но на агентных задачах Volundr уступает: 74,2 против 79-80 на tau2-bench и 44 против 58-64 на подмножестве SWE-bench Verified. Команда сама называет работу с длинными агентными сессиями главным слабым местом Preview и говорит, что в полной версии будет на этом фокусироваться.
Ограничения ощутимые: модель пока грузится только через сборку sglang от Blockway, стандартные sglang и vLLM её не тянут. GGUF и llama.cpp только обещаны. Плюс проект ещё в обучении, так что результаты Preview не стоит принимать за характеристики финальной версии. Код и веса опубликованы под Apache-2.0: страница проекта, модель BF16.
Если вы запускаете модели локально, что для вас важнее: длинный контекст при меньших требованиях к памяти или более надёжная работа агента? Источник: LocalLlama