Услуги Портфолио Контакты БлогНовости +7 (800) 511‑32‑27 Обсудить проект

Стоимость LLM и ROI внедрения ИИ: калькулятор токенов GigaChat, YandexGPT, DeepSeek

Посчитайте, сколько будет стоить API языковой модели при вашей нагрузке, сколько сэкономят кэш, пакетный режим и дешёвая модель для простых запросов — и за сколько месяцев окупится внедрение. Расчёт идёт в браузере, без регистрации.

1Шаблон нагрузки

Цифры шаблонов — ориентир для типовой задачи. Подставьте свои: расчёт обновится сразу.

2Модель и нагрузка

Модель
Нагрузка
шт.
дн.
токенов
токенов
вызовов

Чат-бот отвечает за один вызов. Агент с инструментами обращается к модели много раз за задачу.

Кэширование промпта
Время жизни кэша

Часовой кэш дороже при записи. Он окупается, если запросы с одним и тем же префиксом идут реже, чем раз в 5 минут.

Пакетный режим

Асинхронный (batch) режим дешевле, но ответ приходит не сразу. Подходит для разбора документов, классификации, ночной генерации.

Маршрутизация на дешёвую модель
Прогноз и валюта
Валюта

3Результат

Загружаем справочник цен…

Откуда экономия

Сначала полная цена без оптимизаций, затем вклад каждого рычага по очереди. Серый столбик — рычаг недоступен у этой модели или выключен.

Та же нагрузка на других моделях

С теми же настройками кэша и пакетного режима, без маршрутизации. Отсортировано по цене с оптимизациями.

МодельБез оптимизацийС оптимизациямиЭкономияЗа задачу

Прогноз на 12 месяцев

Рекомендации по вашему расчёту

    Рекомендации и PDF с полным расчётом пришлём на почту.

    Ссылка сохраняет все вводные, включая блок окупаемости. Её можно отправить коллеге.

    Окупаемость внедрения ИИ

    Сравниваем, сколько стоит время операторов на обращениях, которые закроет модель, с расходами на LLM и разовой стоимостью разработки. Цена одного обращения берётся из расчёта выше: модель, токены и оптимизации те же.

    шт.

    мин.

    Возьмите среднее из своей статистики: вместе с поиском ответа и оформлением.

    ₽/ч

    Зарплата с налогами и рабочим местом, делённая на рабочие часы. Для линейной поддержки обычно 300–600 ₽ в час.

    Обычно LLM закрывает типовые обращения, сложные остаются на человеке.

    ч

    Как считается стоимость LLM

    Провайдеры берут деньги за токены: отдельно за вход (промпт, история диалога, найденные документы) и за выход (ответ модели). Калькулятор умножает задачи в день на дни и на число вызовов модели в задаче, получает токены в месяц и умножает на тариф выбранной модели. У GigaChat и YandexGPT тариф указан за 1 000 токенов в рублях, у DeepSeek, OpenAI, Anthropic и Google — за 1 млн токенов в долларах. Калькулятор приводит всё к одной валюте по курсу ЦБ.

    Затем по очереди применяются три рычага. Кэш: неизменная часть промпта после первого запроса читается по сниженной цене. Пакетный режим: запросы, которые могут подождать, идут по асинхронному тарифу. Маршрутизация: простые вопросы уходят на дешёвую модель. Рычаг, которого нет в официальном тарифе модели, не участвует в расчёте. Посмотреть, как ИИ-ассистент работает на настоящем сайте, можно в демо ассистента.

    Откуда цифры

    Справочник цен загружается…

    Хотите проверить экономику на своих данных?

    Разработаем ИИ-агента, чат-бота или поиск по базе знаний под вашу задачу: подберём модель по цене и качеству, настроим кэш и маршрутизацию, посчитаем бюджет до старта. Как это выглядит на практике — в демо ИИ-ассистента.

    Частые вопросы о стоимости LLM

    Как считается стоимость обращения к LLM?
    Провайдер берёт деньги за токены входа и выхода. Калькулятор умножает задачи в день на дни в месяце и на число вызовов модели в задаче, получает токены за месяц и умножает их на тариф. GigaChat и YandexGPT публикуют цену в рублях за 1 000 токенов, DeepSeek, OpenAI, Anthropic и Google — в долларах за 1 млн токенов. Всё приводится к одной валюте по курсу ЦБ, дата курса указана под переключателем валюты.
    Сколько экономит кэширование промптов?
    Зависит от модели и от того, какая часть входа повторяется. У Anthropic, OpenAI, Google и DeepSeek кэшированный вход стоит в 10–50 раз дешевле обычного, и чат-бот с длинным системным промптом экономит на кэше половину счёта и больше. У YandexGPT кэшированный вход стоит столько же, сколько обычный, а GigaChat отдельную цену кэша не публикует, поэтому для них рычаг серый и в сумме не участвует.
    Когда использовать пакетную (batch) обработку?
    Когда ответ не нужен сразу: разбор документов, классификация обращений, генерация описаний товаров, ночные выгрузки. Асинхронный режим у GigaChat и YandexGPT примерно вдвое дешевле синхронного, у зарубежных провайдеров batch API тоже даёт скидку 50 %. Для живого диалога с клиентом пакетный режим не подходит.
    Дешёвая модель — всегда ли дешевле в пересчёте на задачу?
    Нет. Цена за токен — только половина уравнения. Если дешёвая модель чаще ошибается, задачу приходится повторять или передавать человеку, а агенту нужно больше шагов. Поэтому калькулятор предлагает маршрутизацию: простые запросы уходят на дешёвую модель, сложные остаются на сильной. Долю начинайте с 20–40 % и проверяйте качество ответов на этой доле.
    Как часто обновляются цены в калькуляторе?
    Справочник обновляем раз в месяц вместе с курсом доллара. У каждой модели указаны ссылка на официальную страницу тарифов и дата проверки, список — в блоке «Откуда цифры». Если цены старше 60 дней или курс старше 30 дней, калькулятор покажет предупреждение.
    Что входит в расчёт окупаемости внедрения, а что нет?
    Входят время операторов на обращениях, которые закроет модель, расходы на LLM для этих обращений и разовая разработка по ставке 2 800–3 500 ₽ в час. Не входят серверы и векторная база, embedding-модели, интеграции с нестандартными системами, обучение операторов и доработка под конкретный сценарий. Это отдельная оценка: её можно заказать через кнопку консультации.