Коротко
Независимый исследователь формализовал attention через дискретные Persistent State Machines и синтезировал их на FPGA. Цифры энергопотребления впечатляют, но есть критический нюанс: ни одного измерения на реальной плате.
Стандартный attention в LLM — это тяжёлые матричные умножения, которые диктуют весь стек: от VRAM до TDP GPU. Препринт Юсукэ Эсаки предлагает переосмыслить attention как дискретный конечный автомат, где вычисления разлетаются по стационарным in-memory ячейкам, а каждая ячейка локально выполняет детерминированные переходы состояний. Звучит как теоретическое упражнение, но автор довёл дело до синтеза на реальном FPGA-фабрике — и это редкая комбинация.
Математическая часть включает полные доказательства границ ошибок квантования, конструкцию дискретного Softmax с ограниченными логитами и доказательство эквивалентности детерминированному конечному автомату с пространственной факторизацией. Принадлежность к DSPACE(O(n)) означает линейное пространство по длине последовательности — потенциально лучше, чем квадратичная зависимость классического attention. Для практиков это главный теоретический крючок: если формализм корректен, архитектурно attention можно реализовать не как матрицу, а как аппаратный граф переходов.
Два эксперимента на FPGA дают конкретику. На Zynq-7000 (xc7z020) массив из 1024 ячеек (d=128) показал динамическую мощность ядра ниже 1.0 мВт и нормированную энергию 3.81×10⁻⁵ пДж/операцию. На UltraScale+ (xcvu9p) 256-ячеечный подмассив — одна голова attention — встроили в полный SoC с AXI4 и PCIe Gen3 x1. Тайминг закрыт на 62.5 МГц, занято 0.67% логических слайсов и ровно 0.00% DSP-блоков. Функциональная симуляция на 1000+ случайных векторов дала побитовое совпадение с fixed-point программным эталоном.
И вот критическая оговорка, которую сам автор честно фиксирует: все цифры энергопотребления — оценки из симуляционного тулчейна, ни одного физического измерения на плате не проводилось. Энергия системной внешней памяти строго исключена. Это значит, что субмилливаттный результат описывает только синтезированную логику ядра, а не реальную стоимость inference end-to-end. В реальном конвейере именно память часто доминирует в энергобалансе, и 0.00% DSP не гарантирует, что система в целом будет столь же экономичной.
Тем не менее, подход интересен не как готовый продукт, а как доказательство концепции. Если attention действительно сводится к дискретным переходам с линейным пространством, это открывает направление для кастомных ускорителей, где не нужны ни тензорные ядра, ни массивные матричные движки. Заявлена японская патентная заявка (№ 2026-177318), так что автор явно планирует развивать направление.
Главный вопрос, на который препринт пока не отвечает: сохраняется ли битовая точность и линейное пространство при масштабировании за пределы одной головы и d=128. 256-ячеечный подмассив — это демонстрационный фрагмент, а не замена полноценного attention-слоя production-модели. Пока это элегантный теоретический каркас с многообещающей, но неподтверждённой физически аппаратной реализацией.
Источник: Hacker News - Newest: ""AI" "LLM""