Стоимость токенов складывается из двух разных цен: за то, что вы отправляете модели, и за то, что она отвечает. Выходные токены обычно в 3-5 раз дороже входных, поэтому усредненный подсчет "сколько стоит одно сообщение" почти всегда врет. Ниже: формула расчета с реальным примером, ориентиры цен Claude, GPT и DeepSeek на август 2026 года и способ снизить счет за API без потери качества ответа.
TL;DR: Цена запроса к нейросети = input-токены по одной ставке + output-токены по другой, обычно в 3-5 раз выше. Формула ниже позволяет посчитать стоимость любого диалога вручную за минуту. В статье: разбор input/output, ориентиры цен Claude, GPT-5.4 и DeepSeek на август 2026, готовый пример расчета и prompt caching как способ срезать счет на 90%.
Что такое токен и почему за него берут деньги?
Токен, это не буква и не слово, а кусок текста, который модель обрабатывает как одну единицу. Размер куска определяет статистика частых сочетаний, а не грамматика.
Внутри модели нет ни слов, ни предложений. Есть словарь из примерно 100 000 кусочков и таблица чисел под каждый из них. Платите вы именно за обработку этих кусочков, а не за символы или минуты работы сервиса.
Кусочки формируют алгоритмом BPE (byte pair encoding), который считает, какие пары символов встречаются в текстах чаще всего, и склеивает их в один блок. Слово "cat" почти всегда один токен, потому что оно частое. Редкое или составное слово модель порежет на 3-4 токена. Отсюда неочевидный эффект: два вопроса одинаковой длины по буквам могут стоить по-разному, если один написан частыми словами, а второй, редкими терминами или именами собственными.
Русский текст съедает токенов заметно больше английского на ту же мысль. Word-модели тренировали в основном на англоязычных данных, и кириллица режется на более мелкие куски. На практике разница доходит почти до двух раз: одна и та же фраза на русском может занять в полтора-два раза больше токенов, чем ее английский аналог. Для русскоязычного продукта это прямая статья расходов, которую стоит закладывать в юнит-экономику заранее, а не после первого счета от провайдера.

Почему input и output токены стоят по-разному?
Output почти всегда дороже input в 3-5 раз, потому что каждое сгенерированное слово требует полного прохода через все слои модели, а входной текст модель считывает один раз.
У Claude Sonnet 4.6 цена $3 за миллион input-токенов против $15 за миллион output, у GPT-5.4 разрыв еще заметнее: $2,5 против $15. Разница в 5 раз на одном и том же запросе полностью меняет структуру расходов приложения.
Причина в вычислениях. Входной текст модель обрабатывает параллельно и один раз целиком. А ответ она генерирует последовательно, токен за токеном, и на каждый новый токен уходит отдельный полный проход через миллиарды параметров. Чем длиннее ответ, тем больше таких проходов, и тем выше счет. Отсюда практический вывод: если продукт генерирует длинные тексты, экономить нужно в первую очередь на длине ответа, а не на длине промпта. Короткий системный промпт с длинным ответом почти всегда дороже длинного промпта с коротким ответом.

Как посчитать стоимость одного запроса к нейросети?
Формула простая: (input-токены ÷ 1 000 000 × цена input) + (output-токены ÷ 1 000 000 × цена output). Считать нужно оба направления отдельно, иначе цифра будет неточной.
Возьмем диалог среднего размера: пользователь присылает вопрос на 1500 токенов (это примерно страница текста с историей переписки), модель отвечает на 800 токенов. Работаем на Claude Sonnet 4.6 по цене $3 / $15 за миллион.
Расчет выглядит так:
- input: 1500 ÷ 1 000 000 × 3 = $0,0045
- output: 800 ÷ 1 000 000 × 15 = $0,012
- итого за один запрос: $0,0165
Мелочь на один диалог, но при 1000 запросов в день это уже $16,5 в сутки, или почти $500 в месяц только на один сценарий использования. Подставьте свои цифры токенов и цену нужной модели, формула не меняется ни для Claude, ни для GPT, ни для любой другой модели с раздельным тарифом на input и output.
Максим: «GoBanana мы собрали за 3-6 часов после выхода новой модели, и продукт принес 12 миллионов рублей. Но если бы я тогда не прикинул стоимость токенов на пользователя заранее, легко можно было уйти в минус на масштабе. Считать юнит-экономику нужно до запуска, а не после первого крупного счета от провайдера.»

Сколько стоят токены Claude, GPT и DeepSeek на август 2026 года?
Флагманские модели Claude и GPT торгуются в диапазоне $1,25-5 за миллион input-токенов и $10-25 за output. DeepSeek дешевле на порядок за счет более простой архитектуры и меньших расходов на инфраструктуру.
Цены меняются у провайдеров без предупреждения, иногда несколько раз за квартал. Ориентиры ниже актуальны на август 2026 года, но перед запуском в продакшен цену обязательно нужно свериться с официальной страницей тарифов.
| Модель | Input ($/1M токенов) | Output ($/1M токенов) | Для чего подходит |
|---|---|---|---|
| Claude Sonnet 4.6 | $3 | $15 | Баланс цены и качества, универсальные задачи |
| Claude Opus 4.6 | $5 | $25 | Сложная архитектура, глубокий анализ кода |
| GPT-5.4 | $2,5 | $15 | Терминальные задачи, агентные сценарии |
| DeepSeek V3.2 | $0,28 | $0,42 | Простые задачи, экономия на масштабе |
DeepSeek обходится в 10-15 раз дешевле флагманов при похожих результатах на несложных задачах, но разница в качестве на архитектурных и многошаговых сценариях заметна. Почему так выходит по деньгам и стоит ли вообще менять провайдера ради экономии, подробно разобрано в отдельной статье про стоимость токенов DeepSeek и GigaChat.

Что такое prompt caching и как он снижает счет на 90%?
Prompt caching сохраняет неизменную часть промпта (системную инструкцию, документы, историю) и берет за повторное чтение этого куска до 90% меньше стандартной цены input-токенов.
Механика простая. Первый запрос в сессии записывает системный промпт и контекст в кеш по обычной цене, а иногда чуть дороже. Каждый следующий запрос, если контекст не изменился, читает эти же токены уже по сниженному тарифу, у Anthropic и OpenAI это дает экономию порядка 90% именно на кешированной части input.
Для чат-бота с постоянной системной инструкцией на 2000 токенов и десятками сообщений в день эффект накапливается быстро. По факту почти любое приложение с повторяющимся контекстом, служба поддержки, ассистент с базой знаний, RAG-система, получает выгоду от caching без единой строчки изменений в логике продукта. Механизм и настройку под конкретных провайдеров разбираем отдельно в статье про prompt caching и экономию 90% на API.

Стоит ли считать стоимость токенов вручную или доверить это скрипту?
Вручную формулу стоит прогнать один раз, чтобы понять механику. Дальше расчет нужно автоматизировать, иначе на масштабе продукта цифры разъедутся с реальностью за пару недель.
На старте достаточно калькулятора и формулы выше. Но как только запросов становится сотни в день, ручной подсчет перестает успевать за реальностью: меняются модели, растет история диалога, добавляются новые фичи с собственным потреблением токенов. Проще один раз завести логирование input/output по каждому запросу и считать реальную стоимость пользователя автоматически, а не оценкой на глаз.
Как раз такой расчет на реальных цифрах, включая точку безубыточности и цену привлечения пользователя, разобран в статье про юнит-экономику AI-продукта. А если счет за API уже кажется большим и хочется понять, где резать в первую очередь, обычно помогает не смена модели целиком, а роутинг задач между дешевой и дорогой моделью, разобрано в статье про оптимизацию стоимости AI-вызовов.

Итог: как не переплачивать за токены в 2026 году
Три вещи реально сокращают счет без потери качества продукта.
- Первая: считать input и output раздельно с самого начала, а не после первого шокирующего инвойса.
- Вторая: включить prompt caching там, где контекст повторяется, это самый простой рычаг экономии из всех перечисленных.
- Третья: не тащить все задачи на флагманскую модель, простые сценарии спокойно закрывает DeepSeek или младшая модель линейки, а дорогую модель оставить на архитектурные и творческие задачи.
Разница в подходе к расчету стоимости токенов часто и есть разница между продуктом, который окупается на 200 пользователях, и продуктом, который сжигает бюджет еще до первой оплаты.

Глоссарий
- Токен — минимальная единица текста, которую обрабатывает модель. Не буква и не слово, а частотный кусок текста.
- Input-токены — все, что вы отправляете модели: промпт, история диалога, документы.
- Output-токены — текст, который модель сгенерировала в ответ.
- Prompt caching — механизм, который сохраняет неизменную часть контекста и снижает цену на ее повторное чтение.
- BPE (byte pair encoding) — алгоритм, который разбивает текст на токены по частоте встречаемости пар символов.
- Контекстное окно — максимальный объем токенов, который модель способна учитывать в одном запросе.
Частые вопросы про стоимость токенов
Сколько стоит один запрос к Claude или GPT?
Зависит от длины входа и ответа и от модели. По формуле выше средний диалог на 1500 input и 800 output токенов у Claude Sonnet 4.6 обходится примерно в $0,0165. У более дорогой модели или при длинном ответе цифра растет пропорционально.
Почему за русский текст платишь больше, чем за английский?
Модели тренировали в основном на англоязычных текстах, и кириллица режется на более мелкие токены. На одну и ту же мысль русский текст занимает в полтора-два раза больше токенов, чем английский.
Можно ли не считать стоимость токенов, а просто взять лимит по подписке?
Можно, если объем небольшой и подходит фиксированный тариф вроде Claude Pro или ChatGPT Plus. Но для продукта с собственными пользователями рано или поздно придется перейти на API с оплатой за токены, и без формулы расчета юнит-экономика соберется вслепую.
Что дешевле в 2026 году: Claude, GPT или DeepSeek?
DeepSeek дешевле в 10-15 раз на одинаковый объем токенов, но проигрывает на сложных многошаговых задачах. Для простых сценариев вроде классификации или коротких ответов разница в качестве почти незаметна.
Как prompt caching влияет на итоговый счет?
Снижает цену на повторяющуюся часть input-токенов до 90%. Эффект заметен уже при десятках однотипных запросов в день, чем больше повторяющегося контекста в промпте, тем выше экономия.
Нужно ли пересчитывать стоимость при каждом обновлении модели?
Да. Провайдеры меняют тарифы без предупреждения, иногда в рамках одного релиза. Перед запуском в продакшен цену стоит проверять на официальной странице тарифов, а не по старым скриншотам из статей.
Где смотреть актуальные тарифы Claude и GPT?
Официальные страницы anthropic.com/pricing и platform.openai.com/pricing обновляются первыми при изменении цен. Сторонние обзоры, включая эту статью, стоит перепроверять перед расчетом бюджета.
Разобраться, какая модель выгоднее конкретно под вашу задачу, часто быстрее на консультации, чем перебором вручную. Смотрите обзоры AI-инструментов в каталоге VibeCoderz или запишитесь на консультацию к Максиму.
Обновлено: август 2026.