In short
The same number of operations can execute at very different speeds, and on new hardware the relationship turned out to be even less predictable. The breakdown shows why AI efficiency estimates need real measurements rather than a look at FLOPs alone.
Если две модели делают одинаковое число операций, это ещё не значит, что они работают за одинаковое время. Новая проверка исследования про формулу α-FLOPs подтверждает главный тезис: сырые FLOPs плохо подходят для оценки реальной скорости выполнения.
Причина в том, что операции по-разному распараллеливаются. Пространственные размеры вычислений обычно масштабируются легче, чем размеры ядер, поэтому одинаковый формальный объём работы может давать разное время на одном и том же ускорителе.
Но самое интересное начинается на новом железе. Авторы репликации обнаружили скачки и осцилляции времени выполнения — не плавную зависимость, которую удобно описывать одной формулой. α-FLOPs в целом недооценивает реальное время, то есть превращается из полезной поправки в ненадёжный прогноз.
Практический вывод неприятный, но важный: FLOPs можно использовать как грубый ориентир, однако сравнивать эффективность моделей нужно измерениями на конкретном оборудовании. Особенно если речь идёт о выборе архитектуры для продакшена, где важны не абстрактные операции, а задержка, загрузка ускорителя и стоимость запуска.
Есть и отдельный урок для научных работ. При воспроизведении авторам не хватило подробностей о зависимостях и прозрачности данных для регрессии — именно такие пробелы делают проверку результатов заметно сложнее. Для своей реализации они подготовили полный replication package, но сама история показывает: без кода, окружения и исходных данных результат об эффективности остаётся привязанным к конкретной системе и плохо проверяется.
Готовы ли вы доверять FLOPs при выборе модели, если реальное время на вашем железе может вести себя скачками? Источник: cs.AI updates on arXiv.org