• Home
  • News
  • Blog
  • Releases
  • LLM history
  • Compare LLMs
  • Library
  • About
⌘K
Sign in

A blog and notes on development. The easiest way to reach me is via the social links below.

Contacts
talalaev.misha@gmail.com
Documents
Personal data processing policyPersonal data processing consent
Photo: Andrew Neel / Unsplash

FLOPs are not runtime: a new evaluation breaks the simple formula

Sh0ny
Sh0ny
18 августа 2026
  1. Home
  2. Blog
  3. FLOPs are not runtime: a new evaluation breaks the simple formula
1 min read

In short

The same number of operations can execute at very different speeds, and on new hardware the relationship turned out to be even less predictable. The breakdown shows why AI efficiency estimates need real measurements rather than a look at FLOPs alone.

Если две модели делают одинаковое число операций, это ещё не значит, что они работают за одинаковое время. Новая проверка исследования про формулу α-FLOPs подтверждает главный тезис: сырые FLOPs плохо подходят для оценки реальной скорости выполнения.

Причина в том, что операции по-разному распараллеливаются. Пространственные размеры вычислений обычно масштабируются легче, чем размеры ядер, поэтому одинаковый формальный объём работы может давать разное время на одном и том же ускорителе.

Но самое интересное начинается на новом железе. Авторы репликации обнаружили скачки и осцилляции времени выполнения — не плавную зависимость, которую удобно описывать одной формулой. α-FLOPs в целом недооценивает реальное время, то есть превращается из полезной поправки в ненадёжный прогноз.

Практический вывод неприятный, но важный: FLOPs можно использовать как грубый ориентир, однако сравнивать эффективность моделей нужно измерениями на конкретном оборудовании. Особенно если речь идёт о выборе архитектуры для продакшена, где важны не абстрактные операции, а задержка, загрузка ускорителя и стоимость запуска.

Есть и отдельный урок для научных работ. При воспроизведении авторам не хватило подробностей о зависимостях и прозрачности данных для регрессии — именно такие пробелы делают проверку результатов заметно сложнее. Для своей реализации они подготовили полный replication package, но сама история показывает: без кода, окружения и исходных данных результат об эффективности остаётся привязанным к конкретной системе и плохо проверяется.

Готовы ли вы доверять FLOPs при выборе модели, если реальное время на вашем железе может вести себя скачками? Источник: cs.AI updates on arXiv.org

новостиaiразработканаука и техника
More AI-tool write-ups on the Telegram channel — short and to the point
Subscribe on Telegram

Comments

(0)
​