VibeCoderzVibeCoderz
Все статьи
2026/08/049 мин чтения

Prompt injection в Cursor и Claude Code 2026 атаки через README

Prompt injection в AI IDE, это когда агент вроде Cursor или Claude Code читает не ваши инструкции, а команды, спрятанные внутри README, GitHub Issue или ответа API, и выполняет их как настоящий приказ. По данным свежего мета-анализа 78 научных работ,…

Содержание (11)+

Prompt injection в AI IDE, это когда агент вроде Cursor или Claude Code читает не ваши инструкции, а команды, спрятанные внутри README, GitHub Issue или ответа API, и выполняет их как настоящий приказ. По данным свежего мета-анализа 78 научных работ, success rate таких атак против современных защит превышает 85%, если атакующий использует адаптивную стратегию. Ниже разберем механику атаки, реальные инциденты 2026 года и конкретные шаги для вайбкодера, который пускает агента в свой проект каждый день.

В 2026 году indirect prompt injection стала угрозой номер один для агентных AI IDE: атакующие прячут команды в README, комментариях кода и GitHub Issues, а success rate достигает 84-85%. Ниже, конкретные кейсы против Cursor и Claude Code и 10 рабочих способов защиты.

Изображение

Что такое indirect prompt injection в AI IDE?

Изображение

Indirect prompt injection, это внедрение вредоносных инструкций не в сам запрос пользователя, а во внешние данные, которые агент читает по ходу задачи: файл, страницу, тикет.

Агент не отличает "это моя задача от человека" от "это просто текст файла, который я открыл". Он видит один сплошной поток слов. Если внутри этого потока лежит команда, оформленная убедительно, модель может выполнить ее наравне с вашим промптом. Именно эта архитектурная дыра лежит в основе индиректных атак на Cursor и Claude Code.

Разница с прямой инъекцией простая. В прямой атаке вредонос пишет сообщение прямо в чат агенту, и это легко фильтровать. В непрямой атаке вредонос никогда не общается с моделью напрямую: он оставляет ловушку в README чужого репозитория, в тикете поддержки или в комментарии кода и ждет, пока агент сам туда зайдет. Ждать иногда приходится месяцами, зато сработает атака у любого разработчика, который просто откроет зараженный проект.

Технически это не баг, который можно один раз пофиксить. Исследователи, которые описали похожую технику под названием agentjacking, прямо говорят: полностью разделить инструкции и данные в текущей архитектуре LLM невозможно. Значит, речь не про патч, а про постоянное снижение риска.

Как атакующие прячут команды в README и GitHub Issues?

Чаще всего вредоносный текст маскируют под безобидную документацию: инструкцию по установке, описание бага или сообщение об ошибке, которое агент "чинит" сам.

Mozilla зафиксировала схему, где Claude Code читает README с виду нормальными шагами установки, натыкается на специально сломанный Python-пакет, выполняет "команду инициализации" из инструкции, а та тянет DNS TXT-запись и пайпит ее содержимое прямо в bash. Итог, реверс-шелл, который никогда не появляется в виде читаемого текста ни на диске, ни в трафике.

Изображение
Вектор доставкиГде прячут командуРеальный случай 2026
README репозиторияHTML-комментарий или "инструкция по установке"Capsule Security, атака на Cursor через чистый на вид Python-гайд
GitHub IssueЗаголовок или тело тикетаClinejection, автотриаж Cline среагировал на заголовок issue
Сообщение в Slack/MCPТекст, который MCP-сервер отражает агентуCurXecute (CVE-2025-54135), запись .cursor/mcp.json без подтверждения
Ошибка при установке пакета"Команда для исправления" в тексте ошибкиDNS-based reverse shell через Claude Code, разбор Mozilla
Комментарий в PRBase64 внутри комментария кодаВариант "Comment-and-Control" против Cursor, апрель 2026

Общий паттерн один: агенту дают повод самому запустить что-то "для починки". Пользователь ни разу не пишет запросов про SSH, ключи или сеть, а атака все равно срабатывает, потому что решение принимает не человек, а модель, которая доверяет тексту ошибки.

Подробный разбор атаки на README Cursor есть у Capsule Security, а цепочку с DNS-эксфильтрацией разобрал Cybernews со ссылкой на исследование Mozilla.

Почему success rate атак превышает 85%?

Мета-анализ 78 научных работ за 2021-2026 годы показал: против state-of-the-art защит адаптивные атаки успешны в 85%+ случаев, а 18 проверенных механизмов защиты снижают риск меньше чем наполовину.

Фреймворк AIShellJack прогнал 314 уникальных payload'ов на 70 техник MITRE ATT&CK против GitHub Copilot и Cursor. Результат: агент запускал команду в 75-88% сценариев независимо от языка проекта, TypeScript, Python или C++, и в 66,9-84,1% случаев атака доводилась до конца. В одном из сценариев с TypeScript-репозиторием 89% payload'ов вызвали выполнение команды, из них 83,4% оказались успешными атаками.

Без всякой защиты этот показатель по разным исследованиям поднимается выше 90%. С грамотно выстроенными многослойными защитами удается опустить success rate до 8,7%, но большинство команд такие слои просто не настраивают, потому что это неудобно и замедляет агента.

Изображение

Полный текст мета-анализа с методологией и таксономией атак опубликован на arXiv.

Cursor или Claude Code кто безопаснее?

Однозначного победителя нет: обе платформы получали критические уязвимости в 2026 году, а рабочие анти-инъекционные фичи появились у обеих почти одновременно, в конце апреля.

30 апреля 2026 Cursor выкатил Security Review в бета-режиме для тарифов Teams и Enterprise: два постоянных агента, Security Reviewer комментирует каждый PR, Vulnerability Scanner гоняет плановые проверки. Одна из четырех категорий, которые ловит Reviewer, это как раз prompt injection. В ту же неделю Anthropic выпустил Claude Security в публичной бете, со сканированием всей кодовой базы на уязвимости.

До этого у обоих инструментов случались громкие инциденты. У Cursor это CurXecute, когда авто-одобренная запись конфига MCP превращалась в удаленное выполнение кода через одно Slack-сообщение. У Claude Code, DNS-эксфильтрация из CVE-2025-55284, а следом утечка исходников самого продукта 31 марта 2026, 512 тысяч строк TypeScript на npm, где нашли обход правила deny в bashPermissions.ts.

ПараметрCursorClaude Code
Встроенный сканер безопасностиSecurity Review beta, с апреля 2026Claude Security beta, с апреля 2026
Известный инцидент 2026CurXecute, CVE-2025-54135Утечка исходников, обход bashPermissions.ts
Слабое место в отчете вендоруЗакрыли отчет Capsule Security как InformativeПатч вышел за 7 дней после дисклоза Aonan Guan
MCP как вектор атакиДа, авто-одобрение записи конфиговДа, при подключении сторонних MCP-серверов

Честно: реакция на дисклоз у вендоров разная. Cursor в апреле 2026 закрыл отчет исследователей Capsule Security статусом "Informative" и не патчил уязвимость до публичного раскрытия. Anthropic на похожий отчет отреагировал патчем за 7 дней, системный промпт зажали плюс включили default-deny на чтение файлов вне рабочей папки. Это не значит, что один инструмент безопаснее другого навсегда, вектор атаки общий для всех агентных AI IDE, включая Cursor и Claude Code.

Какие реальные атаки на агентов уже случились в 2026 году?

За первые семь месяцев 2026 года зафиксировано минимум пять громких инцидентов indirect prompt injection против Claude Code, Cursor и Cline, от утечки API-ключей до полного реверс-шелла на машине разработчика.

Хронология показывает, насколько быстро это стало операционной угрозой, а не теорией из докладов. Log4Shell превратился в массовую эксплуатацию за шесть недель. Атаке "Comment-and-Control" на это понадобилось 32 дня.

Изображение
ДатаИнцидентЧто произошло
Август 2025Компрометация Nx build systemGitHub Action украл ключи у Claude Code, Gemini CLI и Amazon Q
Январь 2026Уязвимость claude-code-actionRyotaK нашел permission bypass, доверие любому GitHub App-актору
9-17 февраля 2026ClinejectionЗаголовок GitHub Issue взломал автотриаж Cline, эксплойт в проде через 8 дней
Март 2026Первые атаки Unit 42 "в дикой природе"Первые массовые indirect prompt injection зафиксированы вне лабораторий
2 апреля 2026Comment-and-Control против CursorBase64 в комментарии кода обходит regex-фильтры
Конец апреля 2026CurXecute, CVE-2025-54135Slack-сообщение пишет .cursor/mcp.json, RCE через новый MCP-инструмент
25 июня 2026PoC полного захвата Claude CodeИнтерактивный shell с доступом ко всем секретам окружения
Максим: «GoBanana мы собрали за 3 часа голосом в Cursor, агенту тогда дали доступ вообще ко всему в проекте. Сейчас первым делом смотрю, что агент реально может сломать, прежде чем разрешать ему запускать команды без подтверждения. Скорость вайбкодинга и открытые права агенту, это разные вещи, и путать их дорого.»

Можно ли вообще починить prompt injection?

Нет, если ждать одного патча. Исследователи agentjacking прямо говорят: архитектура LLM не разделяет инструкции и данные, поэтому речь идет об ограничении ущерба, а не о лечении причины.

OWASP Top 10 for Agentic Applications 2026, документ, который в декабре 2025 выпустили больше сотни исследователей безопасности, ставит захват цели агента (ASI01) на первое место среди рисков. Это не совпадение. Чем больше у агента инструментов, автономии и доступа к данным, тем шире поверхность атаки, и это верно для любой модели, не только для Cursor или Claude Code.

Но вот в чем штука. Полностью убрать риск нельзя, а вот радикально его снизить, можно уже сегодня, обычной настройкой прав доступа. Дальше, конкретные шаги.

Как защитить агента от prompt injection: 10 способов

Рекомендации собраны из апрельского гайда OpenAI по безопасности агентов и разборов Pillar Security. Работают вместе, ни один способ по отдельности не закрывает риск полностью.

  1. Принцип наименьших привилегий. Агенту нужен доступ только к тем файлам и командам, без которых конкретная задача не решается.
  2. Изолированная среда. Запускайте агента в песочнице, докер-контейнере, Gvisor или Firecracker, а не с правами вашего основного пользователя.
  3. Фильтрация входных данных. Все, что агент читает извне, README, тикеты, ответы API, нужно проверять до передачи в модель.
  4. Валидация ответа перед выполнением. Заставляйте агента отвечать строго заданным форматом, например валидным JSON по схеме, и проверяйте его перед запуском.
  5. Иерархия инструкций. Явно расставляйте приоритет: системный промпт выше логики приложения, та выше пользовательского ввода, а он выше внешних данных.
  6. Метки доверия. Отделяйте собственные инструкции от непроверенного контента специальными тегами прямо в промпте.
  7. Canary-токены. Уникальный секрет в системном промпте сразу покажет, если модель начала его пересказывать наружу.
  8. Лимит действий за сессию. Ограничивайте число вызовов инструментов, чтобы аномальная серия команд бросалась в глаза.
  9. Human-in-the-loop на необратимых действиях. Перед удалением, отправкой данных наружу или установкой пакета, спрашивайте подтверждение у человека.
  10. Мониторинг дрейфа намерения. MCP-шлюзы вроде решения Permit сравнивают заявленную задачу с фактическими действиями агента и блокируют, если отклонение выше порога, в одном публичном разборе блокировка сработала при дрейфе 8,2% против порога 5%.
Изображение

Ни одна мера в одиночку не спасает: SQ Magazine приводит цифру, что многослойная защита снижает success rate атаки с 73,2% до 8,7%, но только при совместном применении нескольких механизмов.

Что делать вайбкодеру прямо сейчас в Cursor и Claude Code?

Три настройки закрывают большую часть риска за один вечер: выключить авто-одобрение команд, ограничить область чтения файлов рабочей папкой и проверять diff перед запуском.

Изображение

Если вы вайбкодите быстро и без команды безопасников за спиной, начните с малого. В Claude Code отключите режим, где агент выполняет команды без вашего подтверждения, особенно если проект тянет чужие зависимости. В Cursor не держите "разрешить все" на постоянку, вместо этого раз в неделю пересматривайте список разрешенных действий агента.

Отдельно проверяйте новые репозитории и пакеты перед тем, как открывать их агентом. README с виду безобидной инструкцией по установке, это ровно тот вектор, который сработал против Claude Code в разборе Mozilla. Если задача связана с MCP-серверами, не подключайте те, что реально не проверяли, потому что именно через отраженный текст MCP-сервера прошла атака CurXecute на Cursor.

И да, для агентных задач с высокой автономией разумно держать отдельного агента под DevOps и безопасность в вашем стеке, который следит за конфигами и правами доступа, пока основной агент пишет фичи.

Глоссарий

  • Prompt injection, внедрение вредоносной инструкции в текст, который читает языковая модель.
  • Indirect prompt injection, та же атака, но команда лежит не в запросе пользователя, а во внешнем контенте: файле, тикете, ответе API.
  • MCP (Model Context Protocol), протокол, который дает агенту доступ к внешним инструментам и сервисам.
  • Sandbox, изолированная среда выполнения, где ошибка или атака не выходит за пределы контейнера.
  • Allowlist, список действий, которые агенту разрешено выполнять без дополнительного подтверждения.
  • Canary-токен, фиктивный секрет в промпте, утечка которого сигнализирует об инъекции.
  • YOLO mode, режим, где агент выполняет команды без подтверждения человека, главный ускоритель ущерба от инъекции.
  • Agentjacking, разговорное название атаки, при которой скрытые в данных команды перехватывают поведение агента.

Частые вопросы о prompt injection в AI IDE

Может ли обычный README реально взломать мой компьютер через Claude Code? Да, именно так сработала атака, которую разобрала Mozilla: README запускает сломанную установку, та тянет DNS-запись и открывает реверс-шелл без единой видимой команды.

Cursor уже исправил уязвимости, о которых писали исследователи? Частично. По CurXecute патч вышел, но отчет Capsule Security про README-атаку в апреле 2026 Cursor закрыл статусом Informative и не патчил до публичного раскрытия.

Нужно ли вообще отказываться от AI-агентов из-за этого риска? Нет, это не про отказ, а про настройку прав. Ограничение привилегий и человек в контуре перед необратимыми действиями снижают риск в разы даже без идеального решения.

Защищает ли антивирус от prompt injection? Нет, антивирус ловит вредоносный код, а не текст-ловушку внутри README. Нужны фильтрация входных данных и ограничение прав агента, а не сигнатурный анализ файлов.

Что такое success rate атаки и почему он такой высокий? Это доля атак, которые довели агента до выполнения вредоносной команды. Против адаптивных атак этот показатель у современных защит превышает 85%, потому что архитектура LLM не отделяет инструкции от данных.

MCP-серверы делают агента более уязвимым? Да, каждый подключенный MCP-сервер расширяет поверхность атаки, потому что агент доверяет тексту, который сервер ему возвращает, как и любому другому источнику данных.

Как понять, что моего агента уже атаковали через prompt injection? Ищите аномальную серию действий: неожиданные сетевые запросы, попытки прочитать файлы вне рабочей папки, установку пакетов, которых вы не просили. Логи аудита и лимит действий за сессию такие вещи подсвечивают быстро.

Итог: как выбрать защиту под свой стек

Если вы вайбкодите соло, начните с трех бесплатных шагов: выключите авто-одобрение команд, ограничьте чтение файлов рабочей папкой, проверяйте новые репозитории перед тем, как открыть их агентом. Если работаете с командой и реальными деньгами в продукте, добавьте песочницу, лимит действий за сессию и мониторинг дрейфа намерения через MCP-шлюз.

Каталог AI-инструментов с обзорами и разбором прав доступа смотрите в каталоге AI IDE на VibeCoderz. Если нужно разобрать конкретно вашу конфигурацию агентов и права доступа в проекте, запишитесь на консультацию к Максиму.

Обновлено: июль 2026.


All Posts

Автор

Елисавета Наговицына
Елисавета Наговицына

Предприниматель · Контент-маркетолог · SEO-стратег · AI-продуктолог

2026/08/04

400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28