Коротко
Сегодня — о том, почему агент ломается не всегда из-за модели, как Cursor выстроила доверие к ИИ и чего добились локальные энтузиасты с квантизацией. В подборке также — инструменты и необычные проекты на базе LLM.
Сегодня — о том, почему агент ломается не всегда из-за модели, как Cursor выстроила доверие к ИИ и чего добились локальные энтузиасты с квантизацией. В подборке также — инструменты и необычные проекты на базе LLM.
🔥 Hot:
🔹 Разбор Scale AI показывает: сбои ИИ-агентов часто происходят на стыках компонентов — Таксономика выделяет 41 режим отказа; замена модели не решила ни один из четырёх разобранных кейсов. 🔹 Cursor выпускает больше 800 PR в месяц с помощью ИИ-агентов — Кейс посвящён тому, как команда выстраивает доверие к агентам в разработке. 🔹 Task-aware-квантизация Qwen3.8-27B приблизилась к качеству BF16 при 15% размера — Автор получил 82,81% против 83,59% у BF16; для reasoning-версии обнаружились проблемы с зацикливанием в коде.
➡️ Новости:
🔹 Simon Willison выпустил llm 0.35
➡️ Полезные материалы:
🔹 Latent Space запустила трекер того, какие инструменты выбирают frontier-модели — Методика основана на масштабных экспериментах с агентами и показывает, что именно выбирают Astra и другие передовые модели.
➡️ Обсуждения и кейсы:
🔹 Warrior Quest использует LLM только для диалогов NPC, оставляя игровой мир детерминированным — Квесты, состояние мира и сюжет контролируются обычными игровыми системами, а модель отвечает за разговоры. 🔹 Qwen3.8-Flash-Next ускорили на 9–12% на двух RTX 3090 при контексте около 119 тысяч токенов — Оптимизация подняла медианную скорость декодирования примерно с 30,2 до 33,3 токена в секунду. 🔹 Энтузиаст собрал C++-движок и 4-битный формат для запуска Qwen3.5 0.8B на CPU — Цель — использовать небольшую модель локально для очистки диктовки, пока GPU занят другой задачей.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.