Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
🎯 О чём этот конспект: Пошаговая методология сокращения расхода токенов в Claude и Claude Code без потери качества генерации. Разбор 5 уровней оптимизации рабочего процесса: от глубокого аудита утечек контекста и поведенческих хаков до архитектурного роутинга моделей, картирования репозиториев через граф зависимостей и экономного UI-дизайна.
👤 Кому будет полезно: Вайбкодерам, разработчикам на базе Claude Code/Cursor, фаундерам AI-проектов и пользователям подписок Claude Pro/Team/Enterprise, регулярно упирающимся в лимиты сообщений и контекстного окна.
✨ Что получите: Готовую систему сокращения расходов токенов минимум в 3 раза, мастер-промпт для автоматического аудита утечек, правила гигиены сессий и навыки интеграции легковесных скиллов взамен перегруженных контекстов.
1. Автоматический аудит контекста: мастер-промпт и отключение скрытых пожирателей токенов
Контекст: Большинство пользователей не понимают, куда уходят токены: при каждом сообщении Claude перечитывает весь стек предзагруженных данных. В fresh-сессию автоматически попадают системные инструкции, конфиги CLAUDE.md, описания MCP-серверов и активные плагины, даже если в текущей задаче они не используются. В реальном аудите автора 97.8% перерасхода токенов приходилось всего на 3 забытые открытые сессии, а суммарный объем неэффективно расходуемого контекста достигал 95.4%. Каждый лишний килобайт в системном промпте отнимает до 9 000 токенов на старте диалога — это эквивалент 17 книжных страниц до отправки первого символа. Системная очистка неактивных коннекторов и тяжелых файлов правил немедленно высвобождает контекстное окно.
Тайминг:[00:55], [01:14], [01:54], [02:18]
Выгода: Мгновенный возврат до 95% контекстного окна на старте; экономия от 9 000 токенов на каждую новую сессию без изменения тарифа.
Как применить:
Шаг 1: Запуск аудита окружения — Claude — Запустите глубокий диагностический промпт, который анализирует все файлы CLAUDE.md, активные скиллы, логи и MCP-серверы на предмет избыточного веса:
Run a complete context and token audit on my current workspace and session.Execute the following 3 phases:Phase 1: Audit- List all tools, connectors, and MCP servers preloaded into this session. Count how many tools each exposes.- Measure the size of every CLAUDE.md file in scope (project and parent folders). Flag any single file over 5KB or if the total CLAUDE.md footprint exceeds 10KB.- Inspect active skills, system prompts, and preloaded rules.- Identify inactive open sessions and calculate wasted baseline tokens per turn.Phase 2: Fix & Apply- Provide an itemized breakdown of redundant tokens.- Generate an optimized, stripped-down version of rules and instructions.- Give exact instructions on what to prune or disconnect immediately.Phase 3: Maintenance Protocol- Outline the top 3 high-impact habits to keep baseline token usage under 2,000 tokens per new turn.
Шаг 2: Удаление неиспользуемых плагинов и коннекторов — Интерфейс Claude — Перейдите в левый нижний угол экрана, нажмите + -> Plugins -> вкладка Connectors. Отключите все интеграции (например, Canva, Slack, Figma), которые не нужны для решения текущей узкой задачи, нажав Disconnect.
Шаг 3: Оптимизация файлов правил — Редактор кода / Терминал — Если суммарный объем файлов CLAUDE.md превышает 10 КБ, сократите их до четких инструкций без общих рассуждений, удалив неактуальные правила и описания архитектуры, которые Claude может прочитать локально по запросу.
Результат: Чистая базовая сессия, расходующая минимальное количество токенов на инициализацию, без скрытой нагрузки от неактивных MCP и раздутых инструкций.
2. Поведенческая гигиена вайбкодинга: 5 ключевых привычек для сохранения контекста
Контекст: Основная причина раннего срабатывания rate limits — не размер кодовой базы, а паттерны взаимодействия пользователя с моделью. Каждое дополнительное сообщение в длинном чате заставляет модель повторно считывать сотни тысяч слов истории диалога. Использование встроенных механизмов вроде /compact не спасает, так как сжатие требует полного прогона всей истории через инференс и тратит драгоценные токены вывода. Частая смена модели или уровня рассуждений (Effort level) внутри одного чата инвалидирует кэш промптов и запускает повторный процессинг контекста. Коррекция ошибок новыми сообщениями вместо прямого редактирования удваивает объем мусора в контексте.
Выгода: Снижение потребления токенов на 40–70% за сессию; предотвращение деградации внимания модели при достижении 100k+ токенов истории.
Как применить:
Шаг 1: Очистка контекста вместо сжатия — Claude Code / Терминал — Завершив логический этап задачи, не используйте /compact. Открывайте новую вкладку либо вводите команду сброса:
/clear
Шаг 2: Правило «Одна сессия — одна модель» — Claude UI / API — Выберите конкретную модель (например, Claude 3.5 Sonnet или Claude 3 Opus) в начале сессии и не переключайте ее до конца задачи. Не меняйте уровень «Effort Level» (Thinking budget) посреди разговора — держите его статичным, чтобы не сбрасывать серверное кэширование промптов.
Шаг 3: Пакетный ввод вопросов (Batching) — Инструменты диктовки (Wispr Flow / Glider) / Клавиатура — Не отправляйте мысли отдельными короткими репликами. Надиктуйте или напишите полный список связанных вопросов и контекста в одном развернутом сообщении, чтобы модель прочитала историю всего один раз:
Перед выполнением задачи дай ответ по следующим 4 пунктам:1. Архитектура эндпоинта аутентификации.2. Схема валидации входных данных через Zod.3. Обработка ошибок при дубликате email.4. Миграция для таблицы users в Prisma.Сгенерируй код только после утверждения общего плана.
Шаг 4: Редактирование сообщений вместо отправки уточнений — Claude UI — Если в промпте допущена опечатка или неверное условие, не пишите «Ой, я имел в виду не X, а Y». Нажмите иконку карандаша на своем предыдущем сообщении, исправьте текст и нажмите Save. Это сотрет ошибочную ветку из контекста и предотвратит галлюцинации.
Шаг 5: Перевод медиафайлов в чистый текст — Локальные скрипты / Конвертеры — Избегайте постоянной отправки «тяжелых» PDF-документов и скриншотов в диалог. Сконвертируйте документацию или логи в плоский Markdown/TXT перед загрузкой.
Результат: Исключение дублирующего чтения контекста сервером, стабильная работа кэша промптов Anthropic и минимальная длина диалога.
3. Устранение проблемы многословия: внедрение лаконичного формата C100
Контекст: Claude от природы склонен к избыточному многословию (Verbosity Problem): модель генерирует длинные вежливые вступления, повторяет условия задачи и дает академические пояснения. Это наносит двойной ущерб: сжигает дорогие токены генерации (output tokens стоят значительно дороже input) и перегружает мозг разработчика. Чем сложнее и длиннее ответ ИИ, тем больше уточняющих вопросов приходится задавать, экспоненциально раздувая контекст чата. Перевод взаимодействия на стандартизированный протокол C100 заставляет модель излагать суть максимально просто — в стиле объяснения пятилетнему ребенку с решением в одно предложение.
Тайминг:[04:48], [05:22], [05:46]
Выгода: Сокращение длины ответов Claude на 60–80%, экономия выходных токенов и времени на чтение документации.
Как применить:
Шаг 1: Создание кастомного скилла C100 — Claude / Claude Code — Создайте переиспользуемый навык (Skill) или зафиксируйте системную инструкцию лаконичного общения:
You must communicate strictly following the C100 Protocol:1. No pleasantries, no boilerplate intros or conversational filler.2. Explain the root problem simply, as if explaining to a 5-year-old (maximum 2 sentences).3. State the exact fix in one direct sentence.4. Output only the necessary modified code block or minimal bulleted instructions.5. If assumptions are required, list them as single words or short phrases.
Шаг 2: Сохранение и вызов скилла — Claude Code — Добавьте инструкцию в локальный конфигуратор скиллов под именем /c100 и вызывайте его при решении технических багов:
/c100 Разбери ошибку TypeError: Cannot read properties of undefined в auth.ts
Шаг 3: Оценка лаконичности — Claude — Убедитесь, что модель перестала дублировать весь файл кода целиком, отдавая только конкретный diff или измененную функцию.
Результат: Короткие, технически емкие ответы без «воды», сокращающие длину контекстного окна и экономящие лимиты на вывод данных.
4. Интеллектуальный роутинг моделей и аудит кода через Codex CLI
Контекст: Использование флагманской или тяжелой reasoning-модели для тривиальных операций (поиск опечатки, сортировка JSON, примитивный рефакторинг) сопоставимо с «использованием бульдозера для открытия дверцы холодильника». Каждая задача требует адекватной вычислительной мощности. При этом сама Claude при длительной работе внутри одного контекста начинает подтверждать собственные ошибки, утверждая, что код работает идеально. Подключение внешнего CLI-инструмента другой архитектуры (например, OpenAI Codex CLI) для независимой проверки кода выявляет критические баги до того, как они заведут разработку в дорогостоящий тупик.
Тайминг:[07:55], [08:14], [08:31], [08:48]
Выгода: Снижение затрат на вызовы API в 5–10 раз за счет перенаправления рутины на дешевые модели; исключение циклов переписывания кода из-за скрытых галлюцинаций.
Как применить:
Шаг 1: Распределение ролей между моделями — Внутренний регламент / Claude Code — Назначьте жесткие роли:
Claude Haiku — «чернорабочий» (grunt worker): парсинг данных, форматирование, генерация базовых тестов, сортировка.
Claude Sonnet — «строитель» (builder): основное написание фич, архитектурные блоки, типовой код.
Claude Opus / High-Effort Reasoning — «архитектор/артист»: принятие фундаментальных архитектурных решений, сложная бизнес-логика, нетривиальный дизайн.
Шаг 2: Независимый аудит через терминал — Codex CLI / Терминал — Не просите Claude перепроверить свой же сложный модуль. Запустите сторонний аудит через командную строку:
Шаг 3: Перекрестный анализ — Claude Code — Скормите вывод аудита Codex обратно в Claude в виде плоского списка замечаний для точечного исправления:
Codex CLI выявил следующие 2 уязвимости в модуле:[Вставить ошибки из терминала]Исправь строго эти участки по протоколу C100.
Результат: Дорогие модели задействованы исключительно там, где требуется максимальный интеллект, а скрытые архитектурные баги устраняются на раннем этапе.
5. Оптимизация работы с кодовыми базами: инструмент Graphify
Контекст: Скармливание Claude целых репозиториев или множества файлов проекта — главный пожиратель контекста в вайбкодинге. Когда агент читает проект файл за файлом, контекстное окно переполняется за несколько итераций. Модели не обязательно видеть тело каждой функции: ей нужна структурная карта зависимостей и взаимосвязей между компонентами. Инструмент Graphify строит граф связей кода, превращая сырой репозиторий в компактную карту зависимостей (Knowledge Graph), что позволяет агенту запрашивать только релевантные узлы графа, не перечитывая исходный код сотен модулей.
Тайминг:[08:56], [09:06], [09:15]
Выгода: Экономия сотен тысяч токенов при первичном онбординге Claude в чужой или крупный проект; исключение чтения несвязанных файлов.
Как применить:
Шаг 1: Установка и индексация репозитория — Терминал — Подключите Graphify к локальному репозиторию для генерации графа связей:
# Установка и генерация графа связей для проектаnpx graphify index ./src --output codebase-graph.json
Шаг 2: Передача карты вместо файлов — Claude Code / Workspace — Загрузите сгенерированный легковесный файл структуры графа в проектное окружение агента:
Перед анализом задачи изучи карту зависимостей проекта codebase-graph.json.Не запрашивай чтение исходного кода файлов, пока не определишь точную цепочку импортов для запрашиваемой функции.
Шаг 3: Таргетированное чтение файлов — Claude Code — Агент использует граф как карту местности и делает запросы read_file только к тем 2–3 файлам, которые непосредственно затронуты изменениями.
Результат: Модель моментально ориентируется в проекте любого масштаба, расходуя на порядок меньше токенов по сравнению с полным сканированием файлов.
6. Экономичный UI/UX дизайн: отказ от скриншотов и кодификация стилей в спецификации
Контекст: Итеративная разработка UI внутри Claude через отправку скриншотов сжигает баланс токенов с максимальной скоростью. Каждый скриншот интерфейса добавляет в контекст около 5 000 токенов. Серия из 20 правок («сделай кнопку круглее», «подвинь карточку правее») суммарно сжигает свыше 100 000 токенов только на обработку изображений. Кроме того, постоянные визуальные доработки приводят к «галлюцинациям стилей». Решение заключается в текстовом описании параметров верстки и мгновенной фиксации удачного стиля в виде 2-килобайтной дизайн-системы (Design Spec Skill), которая навсегда закрывает необходимость отправки скриншотов-референсов.
Тайминг:[09:40], [09:51], [09:65], [09:77]
Выгода: Экономия до 100 000 токенов на каждую дизайн-сессию; мгновенная воспроизводимость фирменного стиля в любых новых компонентах.
Как применить:
Шаг 1: Текстовое описание вместо скриншота — Claude — Вместо загрузки картинки опишите требования конкретными CSS/Tailwind-токенами и семантикой:
Создай карточку продукта:- Тёмная тема: фон bg-zinc-900, бордер border-zinc-800, скругление rounded-2xl.- Типографика: Inter, заголовок font-semibold text-white tracking-tight.- Отступы: p-6, gap-4 между элементами.- Состояние hover: плавный scale-[1.02] за 200ms ease-out.
Шаг 2: Кодификация удачного интерфейса в спецификацию — Claude Code — Как только компонент получился идеальным, потребуйте от Claude зафиксировать все стили в минималистичный файл design-tokens.md (размером до 2 КБ):
Зафиксируй дизайн-систему этого компонента в файл .claude/skills/design-system.md. Включи: палитру цветов, правила теней, сетку отступов, радиусы скруглений и анимации. Размер файла не должен превышать 2 КБ.
Шаг 3: Запуск итерационного дизайн-лупа через субагентов — Claude Code — При необходимости глубокой полировки интерфейса запустите субагента-критика (Design Loop Skill) с жестким ограничением шагов:
Результат: Любой новый UI-компонент генерируется строго по утвержденным токенам без необходимости прикреплять графические референсы и тратить по 5k токенов на каждое изображение.
FAQ
В: Почему команда /compact расходует токены, если она создана для сжатия контекста? О: Для того чтобы сжать контекст, Claude обязан прочитать всю историю сообщений текущего диалога от начала до конца и сгенерировать новое текстовое саммари. Это процесс двойной тарификации: расходуются как входные токены на чтение старых сообщений, так и выходные на написание выжимки. Команда /clear мгновенно обнуляет историю, позволяя начать с чистого листа без вычислительных затрат.
В: Сколько токенов расходует один скриншот интерфейса при отправке в чат? О: В среднем обработка одного изображения стандартного разрешения обходится Claude примерно в 5 000 токенов. Серия из 10–20 визуальных итераций может незаметно сжечь более 100 000 токенов, быстро исчерпав часовые лимиты использования подписки.
В: Чем грозит переключение модели посреди диалога (например, с Sonnet на Opus)? О: Переключение модели ломает механизм кэширования промптов (Prompt Caching). Новая модель вынуждена заново считывать и процессить весь массив накопившегося диалога с нулевого токена по полной стоимости, что моментально приближает вас к Rate Limit.
В: Как понять, что системный файл CLAUDE.md стал слишком тяжелым? О: Если размер одного файла CLAUDE.md превышает 5 КБ, либо суммарный объем инструкций во всех родительских и дочерних папках превышает 10 КБ — файл перегружен. В таких случаях аудит показывает, что до 90% текста составляют общие рекомендации, которые модель знает по умолчанию.
В: Что такое Graphify и чем он лучше стандартного поиска по файлам? О: Graphify создает топологический граф зависимостей и вызовов функций в вашем проекте. Вместо того чтобы перечитывать исходный код десятков файлов в поиске нужного метода, агент сначала сверяется с графом (тратя минимальные токены), а затем точечно считывает только 1–2 целевых файла.
В: Зачем использовать Codex CLI для проверки кода, если Claude уже написала его без ошибок? О: Когда Claude ведет длинную сессию, у нее возникает эффект предвзятости подтверждения (Confirmation Bias): модель склонна подтверждать корректность собственных галлюцинаций. Внешняя модель с другой архитектурой через CLI оценивает код непредвзято и сразу подсвечивает скрытые логические несоответствия и синтаксические дыры.
Ресурсы и ссылки
Graphify — инструмент статического анализа и картирования связей в репозиториях для LLM-агентов — упомянут в видео.
GenSpark (6.0) — мультимодельная рабочая платформа для генерации медиа, слайдов и отчетов — упомянут в видео.
Codex CLI — интерфейс командной строки для запуска кодовых моделей OpenAI и внешнего код-ревью — упомянут в видео.
Wispr Flow / Glider — специализированные инструменты для голосовой непрерывной диктовки промптов — упомянут в видео.
Конспект создан на основе видео «Never Run Out of Claude Tokens (3x Usage System)» канала Jack. Все права на оригинальный материал принадлежат авторам.Источник: https://www.youtube.com/watch?v=xXS83RALMtc