Кэширование промптов в Claude API: цена чтения из кэша и реальная экономия
Кэширование промптов (prompt caching) — механизм Claude API, позволяющий хранить часть контекста между вызовами и не платить за повторную обработку одних и тех же токенов. С выходом Claude Fable 5.1 чтение из кэша подешевело на 75% — до $0,25 за 1M токенов. Подробная документация по механике доступна в официальных доках Anthropic.

Что такое prompt caching и как это работает
Когда вы отправляете запрос к Claude API, входные токены тарифицируются по полной цене. Если тот же контекст — системный промпт, большой документ, история диалога — повторяется в следующем вызове, API может прочитать его из кэша вместо повторной обработки.
Чтение из кэша стоит принципиально дешевле. По данным Anthropic, в поколении Fable 5.1 эта цена снизилась с ~$1 до $0,25 за 1M токенов — снижение на 75%.
Как включить кэширование:
- Используйте модель
claude-fable-5-1. - Поместите повторяющийся контекст в начало промпта.
- Добавьте
cache_control: {type: "ephemeral"}к нужным блокам. - Следующий вызов вернёт
cache_read_input_tokens— платите $0,25 вместо $10. - Проверьте ответ:
cache_creation_input_tokens— первый вызов,cache_read_input_tokens— повторные.
Технические ограничения:
- Минимальный блок — 1024 токена
- TTL — 5 минут (обновляется при каждом обращении)
- Кэшируются системные промпты, документы, история диалога
Цена токенов: базовая и кэшированная
Базовые цены Claude Fable 5.1 не изменились по сравнению с Fable 5. Вот полная картина:
| Тип токенов | Цена за 1M токенов |
|---|---|
| Входные (cache miss) | $10,00 |
| Выходные | $50,00 |
| Чтение из кэша | $0,25 |
| Запись в кэш | $3,75 |
Prompt caching is particularly effective for tasks that involve multiple calls with the same context — like agents, long documents, or repeated system prompts.
Документация Anthropic: Prompt Caching
При цене $0,25 за cache read vs $10 за обычный вход — кэш дешевле в 40 раз. Это меняет экономику сценариев с повторяющимся контекстом кардинально.
Где кэш даёт максимальную экономию
Агентные пайплайны — сценарий, в котором кэш работает лучше всего. ИИ-агент на каждом шаге переотправляет весь накопленный контекст: системный промпт, историю вызовов инструментов, промежуточные результаты. Без кэша каждый шаг тарифицируется по полной цене входа.
Сценарии с наибольшей выгодой от кэширования:
- Агентные пайплайны с повторяющимся системным промптом
- RAG-системы, встраивающие большой документ в каждый запрос
- Мультиходовые диалоги с длинной историей
- Пакетная обработка с одинаковым контекстом
Согласно официальным данным Anthropic, экономия по сравнению с Fable 5 составляет:
| Сценарий | Экономия |
|---|---|
| Типовые задачи (чат, summary) | ~−25% |
| Высокоагентные задачи | до −45% |
Если вас интересует, как Fable 5.1 ведёт себя в кодинг-бенчмарках — читайте разбор Terminal-Bench; а сравнение с облегчённой версией модели — в материале о Claude Mythos 5.1.
В сценариях с одноразовыми уникальными промптами кэш не помогает — нет повторений, нет экономии.
Как оценить выгоду заранее
Посчитайте долю токенов, которая повторяется между вызовами. При 80% повторяющегося контекста и 10 запросах в сессии экономия от кэша составляет ~8×. Детальный обзор цен Claude API и модели claude-fable-5-1 доступны в справочнике моделей. Подключить кэш можно через Claude API или облака AWS, Google Cloud, Azure.
