Коротко
Короткие и синтетические тесты могут скрывать главное: как со временем меняются запросы, модели и связи между пользователями и моделями. Исследование годового production-трейса Chutes показывает, что для LLM-serving важен не только общий объём трафика, но и его внутренняя структура.
Проблема с тестированием LLM-serving не обязательно в нехватке данных. Чаще мы смотрим на них слишком крупным планом: сколько всего запросов, какие модели популярны, какая средняя нагрузка.
Такой взгляд удобен, но он скрывает поведение, от которого зависят кэширование и балансировка нагрузки. Один и тот же общий объём трафика может по-разному нагружать систему — в зависимости от того, какие пользователи обращаются к каким моделям и как эти связи меняются со временем.
Авторы работы проанализировали годовой production-трейс Chutes. В нём есть запросы от множества пользователей к множеству моделей: не только к популярным, но и к моделям из длинного хвоста. Анализ проводился на нескольких уровнях — от общей картины и временной динамики до отдельных моделей и пользователей.
Практический вывод простой: бенчмарк для LLM-serving, собранный на коротком или синтетическом трафике, может проверять не ту систему, которую вы собираетесь эксплуатировать. Для более честной оценки нужны сценарии, где видны изменения нагрузки и структура user–model взаимодействий, а не только усреднённые показатели.
Есть и важное ограничение. Это исследование одного production-трейса — Chutes, пусть и за целый год и с широким охватом моделей и пользователей. Работа не даёт универсального портрета всего рынка, а подробные результаты зависят от того, какие данные будут доступны в полном трейсе. Авторы обещают выпустить его вместе со статьёй, чтобы другие исследователи могли использовать реальные, а не sampled или синтетические workloads.
Если вы тестируете инфраструктуру для LLM, что сейчас сильнее влияет на ваши решения: средняя нагрузка или редкие пользовательские сценарии, которые она прячет? Источник: cs.AI updates on arXiv.org