Кэширование промптов в Claude API: цена чтения из кэша и реальная экономия

Кэширование промптов (prompt caching) — механизм Claude API, позволяющий хранить часть контекста между вызовами и не платить за повторную обработку одних и тех же токенов. С выходом Claude Fable 5.1 чтение из кэша подешевело на 75% — до $0,25 за 1M токенов. Подробная документация по механике доступна в официальных доках Anthropic.

Кэширование промптов Claude API — схема работы prompt caching и экономии токенов
Кэширование промптов в Claude API: чтение из кэша по $0,25 вместо $10 за 1M токенов

Что такое prompt caching и как это работает

Когда вы отправляете запрос к Claude API, входные токены тарифицируются по полной цене. Если тот же контекст — системный промпт, большой документ, история диалога — повторяется в следующем вызове, API может прочитать его из кэша вместо повторной обработки.

Чтение из кэша стоит принципиально дешевле. По данным Anthropic, в поколении Fable 5.1 эта цена снизилась с ~$1 до $0,25 за 1M токенов — снижение на 75%.

Как включить кэширование:

  1. Используйте модель claude-fable-5-1.
  2. Поместите повторяющийся контекст в начало промпта.
  3. Добавьте cache_control: {type: "ephemeral"} к нужным блокам.
  4. Следующий вызов вернёт cache_read_input_tokens — платите $0,25 вместо $10.
  5. Проверьте ответ: cache_creation_input_tokens — первый вызов, cache_read_input_tokens — повторные.

Технические ограничения:

  • Минимальный блок — 1024 токена
  • TTL — 5 минут (обновляется при каждом обращении)
  • Кэшируются системные промпты, документы, история диалога

Цена токенов: базовая и кэшированная

Базовые цены Claude Fable 5.1 не изменились по сравнению с Fable 5. Вот полная картина:

Тип токеновЦена за 1M токенов
Входные (cache miss)$10,00
Выходные$50,00
Чтение из кэша$0,25
Запись в кэш$3,75

Prompt caching is particularly effective for tasks that involve multiple calls with the same context — like agents, long documents, or repeated system prompts.

Документация Anthropic: Prompt Caching

При цене $0,25 за cache read vs $10 за обычный вход — кэш дешевле в 40 раз. Это меняет экономику сценариев с повторяющимся контекстом кардинально.

Где кэш даёт максимальную экономию

Агентные пайплайны — сценарий, в котором кэш работает лучше всего. ИИ-агент на каждом шаге переотправляет весь накопленный контекст: системный промпт, историю вызовов инструментов, промежуточные результаты. Без кэша каждый шаг тарифицируется по полной цене входа.

Сценарии с наибольшей выгодой от кэширования:

  • Агентные пайплайны с повторяющимся системным промптом
  • RAG-системы, встраивающие большой документ в каждый запрос
  • Мультиходовые диалоги с длинной историей
  • Пакетная обработка с одинаковым контекстом

Согласно официальным данным Anthropic, экономия по сравнению с Fable 5 составляет:

СценарийЭкономия
Типовые задачи (чат, summary)~−25%
Высокоагентные задачидо −45%

Если вас интересует, как Fable 5.1 ведёт себя в кодинг-бенчмарках — читайте разбор Terminal-Bench; а сравнение с облегчённой версией модели — в материале о Claude Mythos 5.1.

В сценариях с одноразовыми уникальными промптами кэш не помогает — нет повторений, нет экономии.

Как оценить выгоду заранее

Посчитайте долю токенов, которая повторяется между вызовами. При 80% повторяющегося контекста и 10 запросах в сессии экономия от кэша составляет ~8×. Детальный обзор цен Claude API и модели claude-fable-5-1 доступны в справочнике моделей. Подключить кэш можно через Claude API или облака AWS, Google Cloud, Azure.

FAQ

keyboard_arrow_up