Цена API языковой модели за токены: как считается стоимость входа, выхода и кэша
Разработчики платят за API языковых моделей не за подписку, а за токены — единицы текста на входе и выходе запроса. В экосистеме Kimi K3 цена строится по той же логике: вход дешевле выхода, а повторное использование контекста через кэш снижает счёт в разы. Официальную схему тарификации провайдер публикует в документации на platform.kimi.ai.
Ниже — формула расчёта, разница между входными и выходными токенами, механика кэширования и сравнение тарифов на конкретных цифрах.
Как считается цена токена в API
Итоговая цена запроса складывается из двух отдельных ставок: (число входных токенов × цена за вход) + (число выходных токенов × цена за выход). Провайдеры публикуют цену за 1 миллион токенов (1M) отдельно для входа и выхода — это два разных тарифа, а не единая ставка за весь запрос.
Генерация каждого выходного токена требует полного прохода модели вперёд, тогда как входные токены модель обрабатывает параллельно за один проход. Поэтому у большинства провайдеров выход стоит в 2-5 раз дороже входа: разброс от Gemini Flash-Lite (около 4x) до Claude Opus (5x).
Из чего складывается итоговая стоимость вызова API:
- количество входных токенов промпта — системная инструкция, история диалога, документы;
- количество выходных токенов — видимый ответ модели и служебные токены рассуждений;
- статус кэша — cache-hit или cache-miss для повторяющейся части запроса;
- размер контекстного окна модели, который ограничивает максимальный объём одного вызова.
Как считаются токены входа и выхода
Токенизация — это разбиение текста на фрагменты через алгоритм BPE-токенизации (byte pair encoding), по которым и считается тариф. Русский текст занимает в 1,5-2 раза больше токенов, чем английский эквивалент того же смысла, поэтому один и тот же запрос на русском обойдётся дороже.
Что попадает во входные токены
Во входные токены засчитывается весь промпт: системная инструкция, история диалога, вложенные документы и текущий вопрос пользователя. Чем длиннее история чата, тем больше входных токенов на каждый следующий запрос — если её не обрезать или не кэшировать.
В расчёт входных токенов провайдер включает:
- системный промпт и инструкции агента;
- предыдущие сообщения диалога;
- прикреплённые файлы и документы;
- текущее сообщение пользователя.
Что попадает в выходные токены
Выходные токены — это сгенерированный моделью ответ, включая служебные токены рассуждений (reasoning tokens) у «думающих» моделей. У моделей с расширенным reasoning счёт за выход может вырасти даже при коротком видимом ответе — рассуждения тоже тарифицируются наравне с финальным текстом.
Кэш и cache-hit rate: как снизить цену входа
Кэш промпта — это повторное использование уже обработанной части запроса (системный промпт, длинная история, документ) вместо полного пересчёта на каждый вызов. Провайдер хранит промежуточное состояние модели для повторяющегося префикса запроса, поэтому второй и последующие вызовы с тем же началом обходятся дешевле.
При попадании в кэш (cache-hit) цена входных токенов падает в разы — иногда до 90%+ от базовой ставки cache-miss. У моделей с частыми повторными вызовами (агенты, чат-боты с системным промптом) высокий cache-hit rate становится главным рычагом экономии, часто важнее выбора самой дешёвой модели на бумаге.
Cache-hit rate растёт быстрее всего в сценариях с повторяющимся началом запроса:
- у чат-ботов с фиксированным системным промптом на каждый вызов;
- у агентов, которые многократно обращаются к одному и тому же документу или базе знаний;
- у RAG-пайплайнов с постоянным префиксом инструкций перед вставкой контекста.
Позиционирование модели и подход к тарификации Moonshot AI описывает в техническом блоге kimi.com: дешёвый повторный проход по контексту рассчитан на агентные сценарии с длинной историей, где один и тот же префикс запроса обрабатывается десятки раз.
Разница между тарифами cache-hit и cache-miss хорошо видна на графике сравнения цен вывода между провайдерами.

Именно такое соотношение цен вывода задаёт масштаб экономии, о которой пойдёт речь в разделе с тарифами конкретной модели.
Тарифы актуальной модели Moonshot AI на platform.kimi.ai
Вход и кэш. Официальный прайс модели kimi-k3 на platform.kimi.ai — $3 за 1M токенов при cache-miss и $0,30 за 1M при cache-hit, то есть снижение в 10 раз. Такой разрыв рассчитан на длинный системный контекст — здесь помогает архитектура Kimi Delta Attention, снижающая стоимость обработки длинного контекста 1M токенов.
Выход. Цена генерации — $15 за 1M токенов. Соотношение вход/выход здесь примерно 1:5 при cache-miss, что типично для линейки топовых моделей.
| Параметр | Цена |
|---|---|
| Вход, cache-miss | $3 за 1M токенов |
| Вход, cache-hit | $0,30 за 1M токенов |
| Выход | $15 за 1M токенов |
Прежде чем сравнивать цену выхода с конкурентами, стоит зафиксировать, что учитывает сам тариф:
- ставка привязана к конкретной модели и может отличаться у разных версий одной линейки;
- разработчик платит по факту использования, без минимального месячного платежа;
- при превышении контекстного окна модель либо обрежет историю, либо запрос завершится ошибкой.
Сравнение цены выхода с конкурентами
$15 за 1M выходных токенов — заметно дешевле топовых моделей уровня Claude, но дороже узкоспециализированных бюджетных вариантов. Полная картина по цене выхода — в таблице ниже.
| Модель | Цена выхода, $/1M токенов |
|---|---|
| Claude Fable 5 | $50,00 |
| Модель Moonshot AI | $15,00 |
| GLM-5.2 | $4,40 |
| DeepSeek V4 | $0,87 |
Итог: модель занимает среднюю ценовую позицию — дороже узкоспециализированных дешёвых конкурентов, но существенно дешевле топ-флагманов уровня Claude. Многие из этих моделей — Claude, DeepSeek, GLM — можно предварительно сравнить в интерфейсе нейросетей онлайн, не подключая платный API.
Пример расчёта стоимости запроса
Формулу проще всего проверить на конкретных цифрах — сначала без кэша, затем с ним.
Как посчитать стоимость своего запроса к API:
- Определите число входных токенов запроса (промпт + история + документы).
- Определите ожидаемое число выходных токенов ответа.
- Проверьте статус контекста — cache-hit или cache-miss.
- Умножьте входные токены на ставку входа для нужного статуса кэша.
- Умножьте выходные токены на ставку выхода.
- Сложите обе суммы — это цена одного вызова API.
Запрос без кэша
Запрос на 100 000 входных токенов (cache-miss) и 2 000 выходных токенов: вход — 100 000 × $3 / 1 000 000 = $0,30; выход — 2 000 × $15 / 1 000 000 = $0,03. Итого около $0,33 за один вызов.
Тот же запрос с cache-hit
Если тот же 100-тысячный контекст уже в кэше (cache-hit), вход обойдётся в 100 000 × $0,30 / 1 000 000 = $0,03 — экономия примерно в 10 раз на входной части запроса при неизменной стоимости выхода.
