• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

Квантование — полумера: on-device LLM упирается в шину памяти

Sh0ny
Sh0ny
23 июля 2026
  1. Главная
  2. Блог
  3. Квантование — полумера: on-device LLM упирается в шину памяти
1 мин чтения
Обновлено 25 июля 2026

Коротко

Экстремальная квантизация помогает уместить модель в RAM, но не решает главную проблему — пропускную способность шины. Проект CaSA предлагает вычислять инференс прямо в DRAM, минуя SoC-шину. Разбор аппаратной реальности, которую игнорирует софтверный хайп.

Все говорят про on-device LLM: приватность, экономия на облачном инференсе, новый цикл апгрейда железа. Apple и производители чипов активно двигаются в эту сторону. Квантизация до 1-битных и тернарных весов — как у PrismML Bonsai — позволяет ужать 27B-модель до размеров, которые влезают в память смартфона. Но влезть в RAM и работать в RAM — это разные задачи.

Проблема, которую упускает софтверный мир: веса лежат в памяти, но для каждого токена их нужно перегонять через шину SoC к вычислительным блокам NPU. Гигабайты данных гоняются туда-сюда на каждый шаг генерации. Результат — троттлинг NPU по температуре и быстрый разряд батареи. Это та самая «memory wall», о которой硬件-инженеры знают, а ML-сообщество часто забывает.

Проект CaSA предлагает радикальный ход: не переносить данные к вычислениям, а вычислять прямо внутри DRAM через charge-sharing. Тернарный инференс LLM выполняется в коммерческой off-the-shelf памяти, полностью минуя шину. Автор проекта прямо пишет, что устал от академических симуляций Processing-In-Memory, которые игнорируют физику «голого железа».

Логика понятна: квантизация — это софтверный первый шаг, она уменьшает объём данных. Но физический bottleneck — не размер весов, а стоимость их перемещения. CaSA пытается убрать само перемещение. Если архитектура дойдёт до рабочего прототипа на реальных устройствах, это изменит не только on-device AI, но и весь баланс между облачным и локальным инференсом.

Пока проект на ранней стадии — на Hacker News ноль комментариев и одна точка. Но вопрос, который он ставит, важнее текущей реализации: индустрия оптимизирует софт, а упёрлась в фундаментальное ограничение архитектуры фон Неймана. До тех пор, пока вычисления и память физически разделены шиной, даже 1-битные модели будут платить за каждый токен энергопотреблением и нагревом.

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​