agent-browser — это CLI-инструмент от Vercel Labs, который дает AI-агентам управлять браузером через команды терминала, а не через скриншоты. Вместо картинки страницы (3000-5000 токенов) агент получает текстовый ASCII-wireframe на 200-400 токенов и к…
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
agent-browser — это CLI-инструмент от Vercel Labs, который дает AI-агентам управлять браузером через команды терминала, а не через скриншоты. Вместо картинки страницы (3000-5000 токенов) агент получает текстовый ASCII-wireframe на 200-400 токенов и кликает по стабильным ref-ссылкам вроде @e1. Ниже разберем, как его установить, как устроен workflow из трех шагов и чем он отличается от Playwright с Puppeteer.
agent-browser Vercel Labs решает конкретную проблему браузерной автоматизации для AI: скриншоты страницы стоят дорого в токенах на каждом шаге. Rust CLI с Node.js-фолбэком передает агенту ASCII-wireframe вместо картинки, а ref-based клики не ломаются при ре-рендере страницы. В статье: установка, три шага workflow, сравнение с Playwright и подключение через MCP к Claude Code и Cursor.
agent-browser — это headless-браузер, управляемый командами терминала и заточенный конкретно под AI-агентов, а не под людей-тестировщиков.
Инструмент вышел от Vercel Labs и решает одну боль: классические Playwright и Puppeteer создавались для людей, которые пишут скрипты руками. AI-агенту неудобно работать с их API напрямую — слишком много контекста уходит на разбор селекторов и скриншотов.
Под капотом у agent-browser нативный Rust-бинарник, а если платформа не поддерживается — подключается Node.js-фолбэк. Лицензия Apache 2.0, то есть можно использовать бесплатно и в коммерческих проектах. По умолчанию работает через Chromium, но конфигурируется под Firefox и WebKit.
Разработчики вайбкодинга часто автоматизируют по десять-пятнадцать шагов за сессию: открыть страницу, кликнуть, заполнить форму, проверить результат. Каждый такой шаг в старом подходе — это скриншот. agent-browser убирает эту статью расходов почти полностью.

Один скриншот страницы съедает 3000-5000 токенов, ASCII-wireframe от agent-browser укладывается в 200-400. На многошаговой задаче разница накапливается в разы.
Классический подход "агент видит скриншот" работает, но дорого. Если задача включает 20 шагов взаимодействия со страницей, а на каждый уходит по 3000-4000 токенов на снимок, набегает приличная сумма только на распознавание интерфейса, до всякой полезной работы.
agent-browser вместо картинки строит accessibility-дерево, то есть текстовое описание структуры страницы: где кнопка, где поле ввода, что кликабельно. Команда agent-browser snapshot -i возвращает только интерактивные элементы — агенту не нужно продираться через декоративную разметку. Экономия в 10-15 раз при сопоставимой информативности для принятия решения о следующем клике — это не маркетинговая цифра, а прямое следствие того, что текст компактнее растрового изображения.
Для вайбкодера с большим объемом браузерных задач — мониторинг сайтов, регулярный скрапинг — экономия токенов напрямую видна в счете за API в конце месяца.

Установка укладывается в две команды: npm-пакет глобально и загрузка Chromium через встроенный установщик.
Актуальный способ установки, по данным официального репозитория vercel-labs/agent-browser на GitHub (проверено в 2026 году): npm install -g agent-browser, затем agent-browser install — эта команда скачивает Chrome for Testing. Есть и альтернативы: brew install agent-browser для macOS и cargo install agent-browser, если собираешь из исходников через Rust-тулчейн.
На Linux иногда не хватает системных библиотек для headless-Chromium. Флаг --with-deps при установке решает это автоматически: agent-browser install --with-deps. Ручной вариант — npx playwright install-deps chromium, если нужен более точный контроль над зависимостями.
Отдельный нюанс: на Windows с нативными шеллами PowerShell и CMD у инструмента известны проблемы. Разработчики рекомендуют WSL, пока баг не закрыт наверх.

Workflow укладывается в три команды: open открывает страницу, snapshot возвращает элементы с refs, click или fill взаимодействуют по этим refs.
Сначала агент открывает страницу командой agent-browser open <url>. Дальше идет agent-browser snapshot -i — снимок только интерактивных элементов, каждый получает короткий ref вида @e1, @e2, @e3. И на третьем шаге агент кликает или заполняет поле, ссылаясь именно на этот ref: agent-browser click @e1 или agent-browser fill @e2 "test@example.com".
После любого изменения страницы snapshot нужно снять заново — refs привязаны к текущему состоянию DOM, а не к абстрактной позиции элемента.
Команд под капотом больше: back, forward, reload, close для навигации; type, press, hover, check, select, scroll, drag, upload для взаимодействия; get text, get html, get value, get url для извлечения данных; is visible, is enabled, is checked для проверки состояний. Плюс screenshot --full и экспорт в PDF, если картинка все же нужна для отчета человеку.
| Команда | Что делает |
|---|---|
| open <url> | Переход на страницу |
| snapshot -i | Список интерактивных элементов с refs |
| click @e1 / fill @e2 "текст" | Клик или ввод по ref |
| get text @e1 | Извлечение текста элемента |
| screenshot --full | Полный скриншот, если нужен человеку |

Refs детерминированы и не меняются, пока не изменилась сама страница, поэтому скрипты не ломаются при ре-рендере современных SPA-приложений.
Классическая боль автоматизации на React и подобных фреймворках: CSS-классы и id перегенерируются при каждой сборке, XPath-путь съезжает от лишнего div. Заранее записанный сценарий на Playwright с жестко зашитыми селекторами рассыпается через неделю после деплоя.
agent-browser предлагает два уровня стабильности. Первый — refs из snapshot, привязанные к текущей структуре DOM, а не к CSS-классам. Второй, более человекочитаемый — семантические локаторы: команда вида find --name submit находит элемент по роли и подписи, а не по техническому идентификатору. Такой скрипт понятен и человеку, и агенту, который его пишет по ходу задачи.
Для тестирования это особенно ценно: сценарий переживает редизайн интерфейса, если роли и подписи элементов не поменялись.

Интеграция идет через готовый skill-пакет: команда npx skills add vercel-labs/agent-browser подключает инструмент к Claude Code, Cursor, Windsurf и другим агентам без ручной обвязки.
agent-browser не привязан к одной экосистеме. Работает с Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot, Goose, OpenCode и Windsurf — список поддерживаемых клиентов указан в официальной документации. Skill подтягивается напрямую из репозитория и обновляется вместе с новыми версиями инструмента, поэтому копировать SKILL.md вручную из node_modules разработчики не советуют — файл быстро устаревает.
Есть и вариант через MCP-сервер (например, community-пакет agent-browser-mcp): агент получает инструменты вроде browser_navigate, browser_click, browser_snapshot и вызывает их как любой другой MCP-инструмент, наравне с файловой системой или терминалом.
Отдельная фича — изолированные сессии через флаг --session: можно параллельно гонять несколько браузерных контекстов с разными cookies и хранилищем, что удобно, если несколько агентов тестируют разных пользователей одновременно.
Максим: «Мог просто засесть до пяти ночи и просто там править одну какую-то функцию, которая не работала. Если бы не терпение — в моменте я уже испотел, и мне хотелось просто всё это закрыть. Но я понимал, что это можно решить и нужно решить, чтобы идти дальше.»

Основные сценарии: автотесты веб-приложений, скрапинг данных, мониторинг цен конкурентов и заполнение форм без участия человека.
Юзкейсы делятся на несколько групп. Тестирование: снимок интерактивных элементов плюс проверка is visible / is enabled заменяет часть ручного QA на этапе, когда фичу еще не жалко ломать. Скрапинг и извлечение данных: get text и get html вытаскивают контент без парсинга сырого HTML руками.
Дальше — автозаполнение форм и мониторинг цен: агент открывает страницу конкурента по расписанию, снимает snapshot, вытаскивает цифру цены через get text, сравнивает с предыдущим значением. Флаг --headers пригождается для тестирования эндпоинтов, которые требуют авторизации через токен в заголовке, а --headed включает видимое окно браузера, когда нужно посмотреть на процесс глазами во время отладки.
Отдельно стоит связка с параллельными агентами: несколько изолированных сессий agent-browser позволяют одновременно гонять UI-тестирование, SEO-проверку и проверку доступности — каждая в своем браузерном контексте, без конфликтов по cookies.

Playwright остается более гибким низкоуровневым инструментом для людей-разработчиков, agent-browser выигрывает там, где браузером управляет именно AI-агент, а не человек.
Разница не в возможностях самого браузерного движка — под капотом agent-browser тоже опирается на Chrome DevTools Protocol. Разница в интерфейсе: Playwright и Puppeteer рассчитаны на программиста, который пишет код с явными селекторами. agent-browser рассчитан на агента, который должен сам сообразить, куда кликнуть, прочитав компактный snapshot вместо тысяч строк DOM.
| Критерий | agent-browser | Playwright / Puppeteer |
|---|---|---|
| Целевой пользователь | AI-агент через CLI-команды | Разработчик, пишущий код |
| Формат снимка страницы | ASCII-wireframe, 200-400 токенов | Скриншот или полный DOM |
| Устойчивость к ре-рендеру | Refs и семантические локаторы | CSS-селекторы, XPath |
| Интеграция с AI-агентами | Skills и MCP из коробки | Нужна отдельная обвязка |
| Гибкость для сложной логики | Ограничена набором команд CLI | Полный доступ к API браузера |
Если пишешь классический тестовый фреймворк руками — Playwright остается более гибким выбором. Если строишь агента, который сам решает, куда кликнуть по ходу задачи — agent-browser экономит и токены, и время на обвязку.

Инструмент честно не идеален: на Windows нужен WSL, а ASCII-wireframe хуже справляется с визуально сложными интерфейсами вроде canvas-редакторов и сложных SPA с кастомной отрисовкой.
Первое ограничение — платформенное. На Windows с нативными PowerShell и CMD у agent-browser известные проблемы, разработчики прямо рекомендуют WSL до исправления бага.
Второе ограничение — концептуальное. ASCII-wireframe строится на accessibility-дереве страницы. Для обычных форм, кнопок и списков это работает отлично. Но если интерфейс нарисован на canvas, использует нестандартную кастомную отрисовку или сильно завязан на визуальное расположение элементов без семантической разметки, текстовый снимок теряет часть информации, которую видно только на скриншоте. В таких случаях команда screenshot --full остается запасным вариантом, просто уже не по умолчанию.
Третье — инструмент молодой, и часть продвинутых сценариев (например, сложный мокинг сетевых ответов) пока описана в документации не так подробно, как у зрелого Playwright.

agent-browser бесплатен и распространяется под лицензией Apache 2.0, что разрешает использование в том числе в коммерческих проектах без отчислений.
Прямых расходов на сам CLI нет. Платить придется разве что за инфраструктуру: если гонять десятки параллельных headless-сессий на сервере, это упирается в вычислительные ресурсы, а не в лицензию инструмента. Обновляется одной командой agent-browser upgrade, которая сама определяет, через что был установлен инструмент — npm, Homebrew или Cargo — и подтягивает актуальную версию.
Для вайбкодера, который строит браузерных агентов на Claude Code, Cursor или другом AI-инструменте, agent-browser закрывает конкретную и дорогую проблему — токены на скриншотах. Бесплатная лицензия, готовая интеграция через skills и MCP, разумный набор команд без лишней сложности. Минус один и понятный: на визуально сложных интерфейсах и на Windows без WSL придется подстраиваться.
Обзор инструментов для вайбкодинга смотрите в каталоге AI-инструментов на сайте, а для более глубокой автоматизации браузера пригодится связка с Claude Code.

Нужно ли знать Rust, чтобы пользоваться agent-browser?
Нет. Rust используется только для нативного бинарника внутри инструмента. Пользователь работает через обычные CLI-команды на npm, Homebrew или Cargo, писать код на Rust не требуется.
Работает ли agent-browser без Chromium?
По умолчанию нет, команда agent-browser install скачивает Chrome for Testing. Но инструмент можно сконфигурировать на работу с Firefox или WebKit, если такой движок нужен для конкретной задачи.
Чем refs отличаются от обычных ID элементов на странице?
Refs генерируются заново при каждом snapshot и привязаны к текущему состоянию DOM, а не к атрибуту id в разметке. Это делает их устойчивее к изменениям верстки между релизами.
Можно ли использовать agent-browser в коммерческом проекте бесплатно?
Да, лицензия Apache 2.0 разрешает коммерческое использование без отчислений разработчикам Vercel Labs.
Подходит ли agent-browser для парсинга сайтов с защитой от ботов?
Инструмент решает задачу управления браузером и извлечения данных, но не задачу обхода антибот-систем — это отдельная тема, требующая дополнительных настроек прокси и поведения.
Как agent-browser соотносится с обычными Skills и MCP в Claude Code?
agent-browser подключается к Claude Code именно как skill или MCP-инструмент — то есть используется тот же механизм расширения возможностей агента, который применяется и для других внешних инструментов.
Стоит ли переходить с Playwright на agent-browser, если уже есть готовые тесты?
Не обязательно полностью. Многие вайбкодеры используют Playwright для написанных руками тестов и agent-browser отдельно — для задач, где браузером управляет именно AI-агент в моменте, без заранее записанного сценария.
Источники: официальный репозиторий vercel-labs/agent-browser на GitHub, документация agent-browser.dev. Внутренние материалы по теме: Browser Use — обзор библиотеки, Webwright от Microsoft, обзор Claude Code, Cursor и GitHub Copilot в каталоге AI-инструментов. Разбираетесь, какой стек собрать под задачу — запишитесь на консультацию к Максиму: t.me/maxnagovitsyn.
Обновлено: август 2026.