Коротко
Экстремальная квантизация помогает уместить модель в RAM, но не решает главную проблему — пропускную способность шины. Проект CaSA предлагает вычислять инференс прямо в DRAM, минуя SoC-шину. Разбор аппаратной реальности, которую игнорирует софтверный хайп.
Все говорят про on-device LLM: приватность, экономия на облачном инференсе, новый цикл апгрейда железа. Apple и производители чипов активно двигаются в эту сторону. Квантизация до 1-битных и тернарных весов — как у PrismML Bonsai — позволяет ужать 27B-модель до размеров, которые влезают в память смартфона. Но влезть в RAM и работать в RAM — это разные задачи.
Проблема, которую упускает софтверный мир: веса лежат в памяти, но для каждого токена их нужно перегонять через шину SoC к вычислительным блокам NPU. Гигабайты данных гоняются туда-сюда на каждый шаг генерации. Результат — троттлинг NPU по температуре и быстрый разряд батареи. Это та самая «memory wall», о которой硬件-инженеры знают, а ML-сообщество часто забывает.
Проект CaSA предлагает радикальный ход: не переносить данные к вычислениям, а вычислять прямо внутри DRAM через charge-sharing. Тернарный инференс LLM выполняется в коммерческой off-the-shelf памяти, полностью минуя шину. Автор проекта прямо пишет, что устал от академических симуляций Processing-In-Memory, которые игнорируют физику «голого железа».
Логика понятна: квантизация — это софтверный первый шаг, она уменьшает объём данных. Но физический bottleneck — не размер весов, а стоимость их перемещения. CaSA пытается убрать само перемещение. Если архитектура дойдёт до рабочего прототипа на реальных устройствах, это изменит не только on-device AI, но и весь баланс между облачным и локальным инференсом.
Пока проект на ранней стадии — на Hacker News ноль комментариев и одна точка. Но вопрос, который он ставит, важнее текущей реализации: индустрия оптимизирует софт, а упёрлась в фундаментальное ограничение архитектуры фон Неймана. До тех пор, пока вычисления и память физически разделены шиной, даже 1-битные модели будут платить за каждый токен энергопотреблением и нагревом.
Источник: Hacker News - Newest: ""AI" "LLM""