• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

Attention как конечный автомат: 0.00% DSP и субмилливатт — но только в симуляции

Sh0ny
Sh0ny
2 августа 2026
  1. Главная
  2. Блог
  3. Attention как конечный автомат: 0.00% DSP и субмилливатт — но только в симуляции
2 мин чтения

Коротко

Независимый исследователь формализовал attention через дискретные Persistent State Machines и синтезировал их на FPGA. Цифры энергопотребления впечатляют, но есть критический нюанс: ни одного измерения на реальной плате.

Стандартный attention в LLM — это тяжёлые матричные умножения, которые диктуют весь стек: от VRAM до TDP GPU. Препринт Юсукэ Эсаки предлагает переосмыслить attention как дискретный конечный автомат, где вычисления разлетаются по стационарным in-memory ячейкам, а каждая ячейка локально выполняет детерминированные переходы состояний. Звучит как теоретическое упражнение, но автор довёл дело до синтеза на реальном FPGA-фабрике — и это редкая комбинация.

Математическая часть включает полные доказательства границ ошибок квантования, конструкцию дискретного Softmax с ограниченными логитами и доказательство эквивалентности детерминированному конечному автомату с пространственной факторизацией. Принадлежность к DSPACE(O(n)) означает линейное пространство по длине последовательности — потенциально лучше, чем квадратичная зависимость классического attention. Для практиков это главный теоретический крючок: если формализм корректен, архитектурно attention можно реализовать не как матрицу, а как аппаратный граф переходов.

Два эксперимента на FPGA дают конкретику. На Zynq-7000 (xc7z020) массив из 1024 ячеек (d=128) показал динамическую мощность ядра ниже 1.0 мВт и нормированную энергию 3.81×10⁻⁵ пДж/операцию. На UltraScale+ (xcvu9p) 256-ячеечный подмассив — одна голова attention — встроили в полный SoC с AXI4 и PCIe Gen3 x1. Тайминг закрыт на 62.5 МГц, занято 0.67% логических слайсов и ровно 0.00% DSP-блоков. Функциональная симуляция на 1000+ случайных векторов дала побитовое совпадение с fixed-point программным эталоном.

И вот критическая оговорка, которую сам автор честно фиксирует: все цифры энергопотребления — оценки из симуляционного тулчейна, ни одного физического измерения на плате не проводилось. Энергия системной внешней памяти строго исключена. Это значит, что субмилливаттный результат описывает только синтезированную логику ядра, а не реальную стоимость inference end-to-end. В реальном конвейере именно память часто доминирует в энергобалансе, и 0.00% DSP не гарантирует, что система в целом будет столь же экономичной.

Тем не менее, подход интересен не как готовый продукт, а как доказательство концепции. Если attention действительно сводится к дискретным переходам с линейным пространством, это открывает направление для кастомных ускорителей, где не нужны ни тензорные ядра, ни массивные матричные движки. Заявлена японская патентная заявка (№ 2026-177318), так что автор явно планирует развивать направление.

Главный вопрос, на который препринт пока не отвечает: сохраняется ли битовая точность и линейное пространство при масштабировании за пределы одной головы и d=128. 256-ячеечный подмассив — это демонстрационный фрагмент, а не замена полноценного attention-слоя production-модели. Пока это элегантный теоретический каркас с многообещающей, но неподтверждённой физически аппаратной реализацией.

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaillmразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​