• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Zach M / Unsplash

Почему ваш бюджет на AI-агентов ошибается в 2–3 раза

Sh0ny
Sh0ny
2 августа 2026
  1. Главная
  2. Блог
  3. Почему ваш бюджет на AI-агентов ошибается в 2–3 раза
2 мин чтения

Коротко

Большинство статей о стоимости LLM не учитывают кэширование и батч-скидки — и врут в 2–3 раза. CostPerPrompt пытается считать реальную цену по типу нагрузки: чатбот, агент, RAG, голос.

Когда вы прикидываете стоимость AI-фичи, вы почти наверняка ошибаетесь. Не потому что модель дорогая, а потому что вы считаете по линейной формуле «токены × цена», игнорируя два фактора, которые меняют всё: prompt caching и batch API.

Кэширование повторяемого контекста режет затраты на входные токены до 90%. Батч-обработка даёт ещё ~50% скидку, если вы готовы ждать результат. Большинство статей «сколько будет стоить ваш чатбот» не учитывают ни того, ни другого — и их оценки завышены или занижены в 2–3 раза.

Сайт CostPerPrompt пытается это исправить. Это не просто таблица цен на 232+ моделей, а набор калькуляторов, заточенных под конкретные сценарии.

Что считается отдельно:

  • API Cost Calculator — произвольная нагрузка с учётом кэша и батчей
  • Chatbot Cost — симулирует реальную беседу с растущей историей и повторной отправкой контекста
  • Agent Cost — многошаговые циклы, вызовы инструментов, ретраи
  • RAG Cost — индексирование, ретривал и генерация по отдельности
  • Voice AI — STT + LLM + TTS в расчёте на минуту и на звонок
  • GPU Rental — H100, A100, RTX 4090 у 10 провайдеров

Самый интересный калькулятор — Agent Cost. Многошаговые агенты с вызовами инструментов и повторами — это сценарий, где наивная оценка ломается сильнее всего. На сайте прямо сказано: агенты стоят в 10–30× дороже, чем вы думаете. Это не маркетинговая гипербола, а следствие архитектуры: каждый шаг — новый запрос, каждый запрос тащит за собой весь контекст, ретраи удваивают расход.

Цены на модели на сайте обновляются автоматически. На момент проверки в таблице флагманских моделей — GPT-5.6 Sol, Claude Fable 5, Gemini 3.1 Pro Preview, DeepSeek V4 Pro и другие. Разброс огромный: от $0.09 за миллион входных токенов у DeepSeek V4 Flash до $10 у Claude Fable 5. Выходные токены везде в 3–5× дороже входных.

Отдельный бонус — GPU-калькулятор: один и тот же чип у разных провайдеров может стоить в 5× раз дороже. Если вы думаете про аренду вместо API, это первый экран, на который стоит посмотреть.

Практический вывод: если вы планируете бюджет на AI-фичу и не закладываете кэширование и батчи, вы либо переплатите, либо получите счёт, которого не ждали. Инструмент не идеален — он не учтёт ваши конкретные задержки, rate limits и пиковую нагрузку. Но он честнее, чем умножить цену модели на количество запросов и надеяться.

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaillmбизнес
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​