Коротко
Одинаковое число операций может выполняться с разной скоростью, а на новом железе зависимость оказалась ещё менее предсказуемой. Разбор показывает, почему оценки эффективности AI нужно проверять реальными измерениями, а не только смотреть на FLOPs.
Если две модели делают одинаковое число операций, это ещё не значит, что они работают за одинаковое время. Новая проверка исследования про формулу α-FLOPs подтверждает главный тезис: сырые FLOPs плохо подходят для оценки реальной скорости выполнения.
Причина в том, что операции по-разному распараллеливаются. Пространственные размеры вычислений обычно масштабируются легче, чем размеры ядер, поэтому одинаковый формальный объём работы может давать разное время на одном и том же ускорителе.
Но самое интересное начинается на новом железе. Авторы репликации обнаружили скачки и осцилляции времени выполнения — не плавную зависимость, которую удобно описывать одной формулой. α-FLOPs в целом недооценивает реальное время, то есть превращается из полезной поправки в ненадёжный прогноз.
Практический вывод неприятный, но важный: FLOPs можно использовать как грубый ориентир, однако сравнивать эффективность моделей нужно измерениями на конкретном оборудовании. Особенно если речь идёт о выборе архитектуры для продакшена, где важны не абстрактные операции, а задержка, загрузка ускорителя и стоимость запуска.
Есть и отдельный урок для научных работ. При воспроизведении авторам не хватило подробностей о зависимостях и прозрачности данных для регрессии — именно такие пробелы делают проверку результатов заметно сложнее. Для своей реализации они подготовили полный replication package, но сама история показывает: без кода, окружения и исходных данных результат об эффективности остаётся привязанным к конкретной системе и плохо проверяется.
Готовы ли вы доверять FLOPs при выборе модели, если реальное время на вашем железе может вести себя скачками? Источник: cs.AI updates on arXiv.org