Коротко
Большинство статей о стоимости LLM не учитывают кэширование и батч-скидки — и врут в 2–3 раза. CostPerPrompt пытается считать реальную цену по типу нагрузки: чатбот, агент, RAG, голос.
Когда вы прикидываете стоимость AI-фичи, вы почти наверняка ошибаетесь. Не потому что модель дорогая, а потому что вы считаете по линейной формуле «токены × цена», игнорируя два фактора, которые меняют всё: prompt caching и batch API.
Кэширование повторяемого контекста режет затраты на входные токены до 90%. Батч-обработка даёт ещё ~50% скидку, если вы готовы ждать результат. Большинство статей «сколько будет стоить ваш чатбот» не учитывают ни того, ни другого — и их оценки завышены или занижены в 2–3 раза.
Сайт CostPerPrompt пытается это исправить. Это не просто таблица цен на 232+ моделей, а набор калькуляторов, заточенных под конкретные сценарии.
Что считается отдельно:
Самый интересный калькулятор — Agent Cost. Многошаговые агенты с вызовами инструментов и повторами — это сценарий, где наивная оценка ломается сильнее всего. На сайте прямо сказано: агенты стоят в 10–30× дороже, чем вы думаете. Это не маркетинговая гипербола, а следствие архитектуры: каждый шаг — новый запрос, каждый запрос тащит за собой весь контекст, ретраи удваивают расход.
Цены на модели на сайте обновляются автоматически. На момент проверки в таблице флагманских моделей — GPT-5.6 Sol, Claude Fable 5, Gemini 3.1 Pro Preview, DeepSeek V4 Pro и другие. Разброс огромный: от $0.09 за миллион входных токенов у DeepSeek V4 Flash до $10 у Claude Fable 5. Выходные токены везде в 3–5× дороже входных.
Отдельный бонус — GPU-калькулятор: один и тот же чип у разных провайдеров может стоить в 5× раз дороже. Если вы думаете про аренду вместо API, это первый экран, на который стоит посмотреть.
Практический вывод: если вы планируете бюджет на AI-фичу и не закладываете кэширование и батчи, вы либо переплатите, либо получите счёт, которого не ждали. Инструмент не идеален — он не учтёт ваши конкретные задержки, rate limits и пиковую нагрузку. Но он честнее, чем умножить цену модели на количество запросов и надеяться.
Источник: Hacker News - Newest: ""AI" "LLM""