• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: m. / Unsplash

AI-дайджест: агенты, локальные модели и новые практики

Sh0ny
Sh0ny
8 сентября 2026
  1. Главная
  2. Блог
  3. AI-дайджест: агенты, локальные модели и новые практики
1 мин чтения

Коротко

Сегодня — о том, почему агент ломается не всегда из-за модели, как Cursor выстроила доверие к ИИ и чего добились локальные энтузиасты с квантизацией. В подборке также — инструменты и необычные проекты на базе LLM.

Сегодня — о том, почему агент ломается не всегда из-за модели, как Cursor выстроила доверие к ИИ и чего добились локальные энтузиасты с квантизацией. В подборке также — инструменты и необычные проекты на базе LLM.

🔥 Hot:

🔹 Разбор Scale AI показывает: сбои ИИ-агентов часто происходят на стыках компонентов — Таксономика выделяет 41 режим отказа; замена модели не решила ни один из четырёх разобранных кейсов. 🔹 Cursor выпускает больше 800 PR в месяц с помощью ИИ-агентов — Кейс посвящён тому, как команда выстраивает доверие к агентам в разработке. 🔹 Task-aware-квантизация Qwen3.8-27B приблизилась к качеству BF16 при 15% размера — Автор получил 82,81% против 83,59% у BF16; для reasoning-версии обнаружились проблемы с зацикливанием в коде.

➡️ Новости:

🔹 Simon Willison выпустил llm 0.35

➡️ Полезные материалы:

🔹 Latent Space запустила трекер того, какие инструменты выбирают frontier-модели — Методика основана на масштабных экспериментах с агентами и показывает, что именно выбирают Astra и другие передовые модели.

➡️ Обсуждения и кейсы:

🔹 Warrior Quest использует LLM только для диалогов NPC, оставляя игровой мир детерминированным — Квесты, состояние мира и сюжет контролируются обычными игровыми системами, а модель отвечает за разговоры. 🔹 Qwen3.8-Flash-Next ускорили на 9–12% на двух RTX 3090 при контексте около 119 тысяч токенов — Оптимизация подняла медианную скорость декодирования примерно с 30,2 до 33,3 токена в секунду. 🔹 Энтузиаст собрал C++-движок и 4-битный формат для запуска Qwen3.5 0.8B на CPU — Цель — использовать небольшую модель локально для очистки диктовки, пока GPU занят другой задачей.

📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.

новости
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться

Комментарии

(0)
​