Prompt caching это технология кэширования повторяющихся частей промпта на стороне провайдера, которая убирает повторную обработку одних и тех же токенов при каждом запросе. Anthropic дает скидку 90% на чтение из кэша, OpenAI включает кэш автоматическ…
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
Prompt caching это технология кэширования повторяющихся частей промпта на стороне провайдера, которая убирает повторную обработку одних и тех же токенов при каждом запросе. Anthropic дает скидку 90% на чтение из кэша, OpenAI включает кэш автоматически и режет цену вдвое без единой настройки. Разберем по шагам, как это работает у Anthropic и OpenAI, когда кэш реально включается и сколько денег он снимает со счета за API.
В 2026 году prompt caching, самый доступный способ снизить счет за API без смены модели. Anthropic дает скидку 90% на повторное чтение кэша через параметр cache_control, OpenAI кэширует автоматически и экономит до 50%. В статье: механика обоих провайдеров, таблица сравнения, частые ошибки и разбор реальной экономии на цифрах.
Prompt caching запоминает часть промпта после первого запроса и переиспользует ее вычисления в следующих запросах, вместо того чтобы гонять одни и те же токены через модель заново.
Каждый раз, когда вы отправляете запрос к языковой модели, она сначала обрабатывает весь входной текст, включая системный промпт, инструкции и документы, которые вы уже отправляли пять минут назад. Prompt caching сохраняет промежуточное состояние этой обработки и достает его из памяти при повторном совпадении текста. Итог: меньше вычислений, меньше денег, меньше задержки.
Технически под капотом лежит KV-кэш: сохраненные векторы внимания модели для уже обработанного текста. Модель обрабатывает запрос в две фазы: prefill, где она читает весь входной текст, и decode, где генерирует ответ токен за токеном. Prefill вычислительно тяжелая фаза, и именно ее кэш помогает пропустить при повторе одного и того же префикса.

Частая ошибка новичков: думать, что кэшируется сам ответ модели. Нет, кэшируется входной текст. Если вы спросите одно и то же дважды с разной формулировкой в конце, ответ каждый раз будет сгенерирован заново, но стабильная часть промпта до места расхождения прочитается из кэша и обойдется в разы дешевле.
Anthropic использует явный параметр cache_control: чтение из кэша стоит 10% от обычной цены токена, то есть скидка 90%. Запись обходится дороже базовой цены, но окупается уже на втором обращении.
Anthropic prompt caching запускается вручную. Вы помечаете блок контента параметром cache_control: { type: "ephemeral" } в системном промпте, документе или описании инструментов, и первый запрос записывает этот блок в кэш. Все последующие запросы, которые начинаются с того же префикса, читают его из кэша вместо повторной обработки.
Цена строится так: запись в кэш на 5 минут стоит в 1.25 раза дороже обычного входного токена, запись на час обходится в 2 раза дороже. Зато чтение из кэша в пределах TTL стоит всего 10% от базовой цены, та самая скидка 90%. Каждое обращение к кэшированному блоку продлевает его жизнь, поэтому активная сессия держит кэш теплым без повторной записи.

Максим: «Мы Vibecoderz за неделю собрали тремя скриптами голосом в Claude Code, 6 200 материалов через них прогнали. После такого объема запросов каждый процент экономии на кэше чувствуется в реальных деньгах, а не в теории».
Кэшировать можно не любой текст. У Anthropic есть порог: для Claude Sonnet минимум 1024 токена, для моделей линейки Opus и Haiku порог выше, обычно от 2048 до 4096 токенов в зависимости от версии модели. Все, что короче, кэш просто не подхватит, и в ответе не будет полей cache_creation_input_tokens и cache_read_input_tokens.
TTL по умолчанию: 5 минут. С февраля 2026 доступен часовой TTL за повышенную цену записи, и он окупается уже с третьего чтения за этот час. Еще нюанс: с начала 2026 кэш изолирован на уровне рабочего пространства, а не всей организации, так что если у вас несколько команд на одном аккаунте, у каждой свой кэш.
OpenAI включает кэш автоматически для промптов от 1024 токенов, без параметров и доплаты за запись. Скидка на кэшированные токены фиксированная: 50% от обычной цены.

Здесь разница принципиальная: OpenAI не требует ставить никакие маркеры в запросе. Кэш включается сам, как только стабильный префикс промпта превышает 1024 токена, и растет блоками по 128 токенов. Запись в кэш бесплатна, читаете вы ее или нет, не переплачиваете за это.
Скидка фиксирована на уровне 50% от стандартной цены входного токена для большинства моделей линейки GPT. Кэш живет около 5-10 минут простоя и может сохраняться до часа в периоды низкой нагрузки на серверах OpenAI. Проверить, действительно ли кэш сработал, можно по полю cached_tokens в объекте usage ответа API.
Важный момент для августа 2026: у новых флагманских моделей вроде GPT-5.4 и GPT-5.5 дисконт на кэш подрос до тех же 90%, что и у Anthropic, но это касается конкретно новых моделей, а не всей линейки OpenAI. На массовых GPT-4o и GPT-4.1 все еще действует стандартная скидка 50%.
На бумаге у Anthropic скидка выше, 90% против 50%. Но OpenAI не требует настройки и не берет денег за запись, поэтому при низкой частоте повторов он может оказаться дешевле в моменте.
Прямое сравнение зависит от паттерна использования. Если вы шлете запросы часто и с одинаковым префиксом, платная запись у Anthropic окупается за один-два обращения, а дальше 90% экономии перекрывает все. Если запросы редкие и кэш успевает остыть между ними, разница сокращается.

| Провайдер | Настройка | Скидка на чтение | Стоимость записи | TTL | Минимум токенов |
|---|---|---|---|---|---|
| Anthropic Claude | Явная, cache_control | 90% | +25% (5 мин) / +100% (1 час) | 5 мин / 1 час | 1024–4096 в зависимости от модели |
| OpenAI GPT | Автоматическая | 50% (до 90% у GPT-5.4/5.5) | Бесплатно | 5-10 мин, до 1 часа в низкий трафик | 1024, шаг 128 |
| Google Gemini | Явная, отдельный API | Зависит от объема | Почасовое хранение | Настраиваемый | от 32 000 токенов |
Gemini заходит с другой стороны: явное кэширование контекста требует блока от 32 000 токенов и отдельной почасовой платы за хранение, зато позволяет держать кэш живым дольше часа. Для коротких системных промптов это избыточно, для кэширования целой базы знаний или объемной документации, вариант рабочий.
Prompt caching окупается там, где один и тот же контекст переиспользуется десятки или сотни раз: агенты с фиксированным набором инструментов, чат-боты с длинной системной инструкцией, работа с большими документами.

Разговорные агенты, классический кейс. Каждый ответ в диалоге тянет за собой всю историю переписки, и без кэша стоимость запроса растет почти линейно с каждым сообщением. С кэшем платите по полной цене только за новый кусок сообщения.
Определения инструментов (tool use) обычно занимают тысячи токенов и не меняются от запроса к запросу. Кэшировать их отдельным блоком логично: агент вызывается многократно за сессию, а набор функций у него один и тот же.
Если приложение отвечает на вопросы по одной и той же книге, договору или базе знаний, документ имеет смысл закинуть в кэшируемый блок один раз, а вопросы пользователя оставить динамической частью в конце промпта. Здесь и разница особенно заметна: известен разбор, где агент для анализа логов с $720 в месяц на API упал до $72 после добавления всего трех меток cache_control в системный промпт и описания инструментов, без смены модели и трафика.

Лиза: «Раньше руками разбирала по 15-20 видео на один материал. Написала скрипт в Google Таблицах: вставляешь ссылки, дальше транскрибация и разбор по 15 критериям. 4 часа превратились в 5,5 минуты».
Скрипт Лизы прогоняет одну и ту же инструкцию по критериям через десятки видео подряд, ровно тот паттерн, где стабильный системный промпт плюс переменные данные на входе включает кэш на полную мощность.
Кэш ломается от динамических данных в статичной части промпта: временных меток, id сессии, меняющегося списка инструментов. Держите изменяющееся в конце запроса, а не в начале.
Порядок промпта решает все. Стабильная информация, системные инструкции, документы и описания инструментов должны идти первыми. Данные пользователя, id запроса, любые переменные значения нужно ставить строго в конце. Если поменять местами, каждый новый запрос будет считаться новым префиксом, и кэш ни разу не сработает.

Смена модели посреди сессии, добавление или удаление инструмента, временная метка в системном промпте, наивная компрессия истории диалога прямо посередине разговора и обновление версии агента. Любое из этих действий меняет начало промпта, и кэш инвалидируется целиком, даже если поменялся один токен из тысячи.
Практический прием: если нужно передать время суток или контекст сессии, вставляйте это не в системный промпт, а отдельным сообщением ближе к концу диалога, как system reminder. Тогда стабильная часть остается нетронутой, а кэш продолжает работать.
Когда диалог разрастается и требует сжатия, добавляйте промпт компрессии как последнее сообщение пользователя, а не переписывайте начало истории. Это сохраняет уже закэшированный префикс и не заставляет платить заново за весь накопленный контекст.
Для отладки полезно смотреть на панель аналитики кэша в консоли разработчика Anthropic. Там видно read ratio и амортизацию затрат на запись, что помогает понять, реально ли кэш окупается на вашем трафике или его настройка была зря.
Чат-бот с системным промптом на 5000 токенов и 10 000 диалогов в день без кэша тратит 50 миллионов токенов в сутки только на повторение инструкций. С кэшем эта часть счета падает почти на порядок, разберем на цифрах.
Возьмем Claude Sonnet 4.6 по цене $3 за миллион входных токенов. Без кэша 50 миллионов токенов системного промпта в день обойдутся в 150 долларов ежедневно, и это без единого пользовательского сообщения. С кэшированием первый запрос в цикле пишет кэш по цене $3.75 за миллион, а следующие 9999 читают его по $0.30 за миллион. Итоговая стоимость этой части падает примерно до 15-20 долларов в день, экономия больше 85%.

На OpenAI логика проще для расчета: скидка фиксированная, применяется сама, и не нужно закладывать стоимость записи. Разница в том, что при низкой частоте запросов, скажем раз в 10 минут, кэш у OpenAI может успеть остыть, а у Anthropic часовой TTL при доплате за запись останется теплым дольше.
Кэширование снижает цену за повторяющиеся токены, retrieval снижает количество токенов, которые вообще отправляются в модель. Это разные инструменты, и в продакшене их обычно комбинируют.
Если приложению нужен весь документ целиком для рассуждения, кэш выигрывает. Если запрос требует лишь маленький кусок из огромной базы знаний, отправлять ее целиком в кэшируемом блоке избыточно, дешевле сделать retrieval нужного фрагмента и не кэшировать вообще. Production-системы часто держат стабильные инструкции в кэше, а динамические знания подтягивают через retrieval отдельно.

Что такое prompt caching простыми словами? Это способ не платить за одну и ту же часть промпта каждый раз заново. Провайдер запоминает обработанный текст и достает его из памяти при повторном запросе с тем же началом.
На сколько реально дешевле с prompt caching у Anthropic? Чтение из кэша стоит 10% от обычной цены токена, то есть скидка 90%. Запись стоит дороже обычной цены на 25% или 100% в зависимости от TTL, но окупается за одно-два повторных обращения.
Нужно ли что-то настраивать для кэша у OpenAI? Нет, кэш включается автоматически для промптов от 1024 токенов. Никаких параметров в запросе указывать не нужно, скидка 50% применяется сама.
Почему у меня не работает кэш, хотя я поставил cache_control? Скорее всего промпт короче минимального порога модели или динамические данные стоят в начале запроса, а не в конце. Проверьте поля cache_creation_input_tokens и cache_read_input_tokens в ответе API.
Сколько живет кэш промпта? У Anthropic по умолчанию 5 минут, с опцией продлить до часа за повышенную цену записи. У OpenAI 5-10 минут простоя, иногда до часа в периоды низкой нагрузки на серверах.
Стоит ли использовать prompt caching для маленьких проектов? Если у вас единичные запросы без повторяющегося контекста, разница будет незаметной. Кэш раскрывается там, где один и тот же промпт вызывается десятки раз подряд, например в агентах или чат-ботах.
Можно ли кэшировать вместе с Gemini? Да, но механика другая: нужен блок минимум от 32 000 токенов и отдельная почасовая плата за хранение. Для коротких системных промптов это невыгодно.
Prompt caching это сохранение обработанной части промпта на стороне провайдера для переиспользования в следующих запросах.
cache_control это параметр в API Anthropic, которым помечают блок контента для кэширования.
TTL (time to live) это время жизни закэшированного блока до его удаления из памяти.
KV-кэш это сохраненные векторы внимания модели для уже обработанного текста, техническая основа prompt caching.
Prefill это фаза обработки входного текста моделью перед началом генерации ответа.
Cache hit / cache miss это успешное или неуспешное совпадение нового запроса с уже закэшированным префиксом.
Если вы собираете агента или продукт поверх Claude API и хотите сразу заложить правильную архитектуру промптов, посмотрите обзор Claude Code в каталоге VibeCoderz, там разобрана структура запросов на реальных сценариях. Разработчикам, которые строят cost-эффективные AI-продукты, может пригодиться подборка в разделе агенты для разработчиков и DevOps.
Полный каталог AI-инструментов и IDE с ценами и сравнениями смотрите в каталоге VibeCoderz. Если считаете unit-экономику своего AI-продукта и не понимаете, где утекают токены, запишитесь на консультацию к Максиму, он разбирал такие кейсы на своих проектах вживую.
Обновлено: август 2026