Цена API языковой модели за токены: как считается стоимость входа, выхода и кэша

Разработчики платят за API языковых моделей не за подписку, а за токены — единицы текста на входе и выходе запроса. В экосистеме Kimi K3 цена строится по той же логике: вход дешевле выхода, а повторное использование контекста через кэш снижает счёт в разы. Официальную схему тарификации провайдер публикует в документации на platform.kimi.ai.

Ниже — формула расчёта, разница между входными и выходными токенами, механика кэширования и сравнение тарифов на конкретных цифрах.

Как считается цена токена в API

Итоговая цена запроса складывается из двух отдельных ставок: (число входных токенов × цена за вход) + (число выходных токенов × цена за выход). Провайдеры публикуют цену за 1 миллион токенов (1M) отдельно для входа и выхода — это два разных тарифа, а не единая ставка за весь запрос.

Генерация каждого выходного токена требует полного прохода модели вперёд, тогда как входные токены модель обрабатывает параллельно за один проход. Поэтому у большинства провайдеров выход стоит в 2-5 раз дороже входа: разброс от Gemini Flash-Lite (около 4x) до Claude Opus (5x).

Из чего складывается итоговая стоимость вызова API:

  • количество входных токенов промпта — системная инструкция, история диалога, документы;
  • количество выходных токенов — видимый ответ модели и служебные токены рассуждений;
  • статус кэша — cache-hit или cache-miss для повторяющейся части запроса;
  • размер контекстного окна модели, который ограничивает максимальный объём одного вызова.

Как считаются токены входа и выхода

Токенизация — это разбиение текста на фрагменты через алгоритм BPE-токенизации (byte pair encoding), по которым и считается тариф. Русский текст занимает в 1,5-2 раза больше токенов, чем английский эквивалент того же смысла, поэтому один и тот же запрос на русском обойдётся дороже.

Что попадает во входные токены

Во входные токены засчитывается весь промпт: системная инструкция, история диалога, вложенные документы и текущий вопрос пользователя. Чем длиннее история чата, тем больше входных токенов на каждый следующий запрос — если её не обрезать или не кэшировать.

В расчёт входных токенов провайдер включает:

  1. системный промпт и инструкции агента;
  2. предыдущие сообщения диалога;
  3. прикреплённые файлы и документы;
  4. текущее сообщение пользователя.

Что попадает в выходные токены

Выходные токены — это сгенерированный моделью ответ, включая служебные токены рассуждений (reasoning tokens) у «думающих» моделей. У моделей с расширенным reasoning счёт за выход может вырасти даже при коротком видимом ответе — рассуждения тоже тарифицируются наравне с финальным текстом.

Кэш и cache-hit rate: как снизить цену входа

Кэш промпта — это повторное использование уже обработанной части запроса (системный промпт, длинная история, документ) вместо полного пересчёта на каждый вызов. Провайдер хранит промежуточное состояние модели для повторяющегося префикса запроса, поэтому второй и последующие вызовы с тем же началом обходятся дешевле.

При попадании в кэш (cache-hit) цена входных токенов падает в разы — иногда до 90%+ от базовой ставки cache-miss. У моделей с частыми повторными вызовами (агенты, чат-боты с системным промптом) высокий cache-hit rate становится главным рычагом экономии, часто важнее выбора самой дешёвой модели на бумаге.

Cache-hit rate растёт быстрее всего в сценариях с повторяющимся началом запроса:

  • у чат-ботов с фиксированным системным промптом на каждый вызов;
  • у агентов, которые многократно обращаются к одному и тому же документу или базе знаний;
  • у RAG-пайплайнов с постоянным префиксом инструкций перед вставкой контекста.

Позиционирование модели и подход к тарификации Moonshot AI описывает в техническом блоге kimi.com: дешёвый повторный проход по контексту рассчитан на агентные сценарии с длинной историей, где один и тот же префикс запроса обрабатывается десятки раз.

Разница между тарифами cache-hit и cache-miss хорошо видна на графике сравнения цен вывода между провайдерами.

График цены за миллион токенов вывода: Kimi K3, Claude Fable 5, GLM-5.2, DeepSeek V4
Цена вывода $15 за 1M токенов — более чем втрое дешевле Claude Fable 5.

Именно такое соотношение цен вывода задаёт масштаб экономии, о которой пойдёт речь в разделе с тарифами конкретной модели.

Тарифы актуальной модели Moonshot AI на platform.kimi.ai

Вход и кэш. Официальный прайс модели kimi-k3 на platform.kimi.ai — $3 за 1M токенов при cache-miss и $0,30 за 1M при cache-hit, то есть снижение в 10 раз. Такой разрыв рассчитан на длинный системный контекст — здесь помогает архитектура Kimi Delta Attention, снижающая стоимость обработки длинного контекста 1M токенов.

Выход. Цена генерации — $15 за 1M токенов. Соотношение вход/выход здесь примерно 1:5 при cache-miss, что типично для линейки топовых моделей.

ПараметрЦена
Вход, cache-miss$3 за 1M токенов
Вход, cache-hit$0,30 за 1M токенов
Выход$15 за 1M токенов

Прежде чем сравнивать цену выхода с конкурентами, стоит зафиксировать, что учитывает сам тариф:

  • ставка привязана к конкретной модели и может отличаться у разных версий одной линейки;
  • разработчик платит по факту использования, без минимального месячного платежа;
  • при превышении контекстного окна модель либо обрежет историю, либо запрос завершится ошибкой.

Сравнение цены выхода с конкурентами

$15 за 1M выходных токенов — заметно дешевле топовых моделей уровня Claude, но дороже узкоспециализированных бюджетных вариантов. Полная картина по цене выхода — в таблице ниже.

МодельЦена выхода, $/1M токенов
Claude Fable 5$50,00
Модель Moonshot AI$15,00
GLM-5.2$4,40
DeepSeek V4$0,87

Итог: модель занимает среднюю ценовую позицию — дороже узкоспециализированных дешёвых конкурентов, но существенно дешевле топ-флагманов уровня Claude. Многие из этих моделей — Claude, DeepSeek, GLM — можно предварительно сравнить в интерфейсе нейросетей онлайн, не подключая платный API.

Пример расчёта стоимости запроса

Формулу проще всего проверить на конкретных цифрах — сначала без кэша, затем с ним.

Как посчитать стоимость своего запроса к API:

  1. Определите число входных токенов запроса (промпт + история + документы).
  2. Определите ожидаемое число выходных токенов ответа.
  3. Проверьте статус контекста — cache-hit или cache-miss.
  4. Умножьте входные токены на ставку входа для нужного статуса кэша.
  5. Умножьте выходные токены на ставку выхода.
  6. Сложите обе суммы — это цена одного вызова API.

Запрос без кэша

Запрос на 100 000 входных токенов (cache-miss) и 2 000 выходных токенов: вход — 100 000 × $3 / 1 000 000 = $0,30; выход — 2 000 × $15 / 1 000 000 = $0,03. Итого около $0,33 за один вызов.

Тот же запрос с cache-hit

Если тот же 100-тысячный контекст уже в кэше (cache-hit), вход обойдётся в 100 000 × $0,30 / 1 000 000 = $0,03 — экономия примерно в 10 раз на входной части запроса при неизменной стоимости выхода.

FAQ

keyboard_arrow_up