Webwright — открытый фреймворк от Microsoft Research, который меняет саму механику браузерных агентов. Вместо того чтобы предсказывать следующий клик на странице, модель пишет и запускает Playwright-код в терминале, а браузерная сессия становится расходным материалом, который можно открыть и выбросить. Именно этот подход дал фреймворку лучший результат среди открытых решений на бенчмарке Online-Mind2Web.
Webwright — это терминальный фреймворк Microsoft Research (релиз 4 мая 2026), где модель пишет Playwright-скрипты вместо пошаговых кликов. На Online-Mind2Web с GPT-5.4 фреймворк набирает 86,7%, на Odysseys — 60,1%. В статье: архитектура цикла, разбор бенчмарков, установка плагина для Claude Code и Codex, кому подходит инструмент.
Что такое Webwright и зачем Microsoft создала этот фреймворк?
Webwright — это исследовательский open-source фреймворк для браузерных агентов, который даёт модели терминал вместо привычного цикла "смотри на страницу, кликай, смотри снова".
Кодовая база занимает около 1500 строк в трёх модулях: цикл агента, окружение на Playwright и CLI, который их связывает. Никакой мультиагентной оркестрации, графов состояний или сложных архитектурных схем — всё построено на одном простом принципе, который GitHub-репозиторий проекта формулирует как идею "терминал — это всё, что нужно для веб-агентов".
Причина появления Webwright простая. Классические браузерные агенты держат один живой сеанс браузера и гадают следующее действие: клик, ввод текста, скролл. Каждая ошибка селектора тянет за собой следующую, а долгие задачи ломаются каскадом мелких сбоев. Webwright разрывает эту связку между агентом и сессией браузера, и это меняет всё дальнейшее поведение системы.

Чем Webwright отличается от обычных браузерных агентов?
Обычный агент предсказывает клики по живой странице и хранит состояние в браузере. Webwright пишет код, запускает и выбрасывает сессии, а хранит состояние в рабочей директории — коде, скриншотах и логах.
Разница на практике ощутимая. Мы в VibeCoderz уже разбирали похожий по духу инструмент, Browser Use — там агент тоже управляет браузером, но действует пошагово, через прямое предсказание клика по элементу. Webwright устроен иначе: он пишет полноценный скрипт с Playwright-селекторами, точно так же, как это делает разработчик-человек, а не гадает следующий пиксель.
Отсюда практическое преимущество. Скрипт можно переиспользовать и параметризовать: подставить другую дату, другой город, другой товар. Пошаговый агент каждый раз заново проходит одну и ту же логику с нуля, даже если задача почти идентична предыдущей.

Как устроен цикл работы Webwright изнутри?
Цикл состоит из четырёх шагов: контекст модели, код от модели, выполнение в терминале, проверка результата. Он повторяется, пока агент не пройдёт собственную самопроверку.
Раннер передаёт модели контекст: задачу, текущее состояние рабочей директории и последние наблюдения. Модель в ответ выдаёт блок рассуждения и bash-команду, часто с небольшим Playwright-скриптом внутри. Окружение выполняет команду и возвращает вывод терминала, логи или трейс ошибки, если что-то пошло не так. Дальше агент либо уточняет подход, либо завершает задачу.
Здесь есть важный нюанс, который Microsoft Research описывает в своей статье как решение двух главных проблем открытых bash-действий: преждевременное "готово" и переполнение контекста. Прежде чем система примет задачу как завершённую, агент обязан сгенерировать финальный скрипт, прогнать его в чистой пустой папке, сохранить логи и вынести собственный вердикт успех или провал.
По сути, модель заставляют перепроверить свою же домашнюю работу с нуля. А чтобы длинные траектории не выжирали контекст, история сжимается в единое summary каждые 20 шагов.

Какие результаты Webwright показывает на бенчмарках Online-Mind2Web и Odysseys?
На Online-Mind2Web (300 задач, 136 сайтов) Webwright с GPT-5.4 набирает 86,7% — лучший результат среди открытых решений. На Odysseys, бенчмарке долгих сценариев, результат 60,1% против прежнего максимума 44,5%.
Цифры стоит смотреть в паре, потому что модели ведут себя по-разному. Claude Opus 4.7 через Webwright набирает 84,7% в общем зачёте Online-Mind2Web, но на самых сложных задачах (11 и более шагов) он обходит GPT-5.4: 80,5% против 76,6% при бюджете в 100 шагов. Причём Opus решает задачи в среднем за 21,9 шага, тогда как GPT-5.4 тратит 26,3 шага — при том что стоит токен у Opus дороже.
| Метрика | Webwright + GPT-5.4 | Webwright + Claude Opus 4.7 |
|---|---|---|
| Online-Mind2Web (общий) | 86,7% | 84,7% |
| Online-Mind2Web (hard, N=100) | 76,6% | 80,5% |
| Odysseys (долгие сценарии) | 60,1% | — |
| Средние шаги на задачу | 26,3 | 21,9 |
На Odysseys, где инструкции в среднем занимают 272 слова, а задачи растянуты на десятки шагов, прежний максимум держал Claude Opus 4.6 с показателем 44,5%, используя классический подход с постоянным браузером и предсказанием координат. Webwright с GPT-5.4 поднимает планку до 60,1% — это на 35,1% выше прежнего рекорда и на 26,6 процентных пункта выше базовой версии самого GPT-5.4 (33,5%) без терминального подхода.

Работает ли Webwright с небольшими моделями вроде Qwen?
Да. Небольшая модель Qwen3.5-9B, дополненная готовой библиотекой инструментов, набирает 66,2% на сложном сплите Online-Mind2Web — почти догоняя флагманов.
Тут кроется, пожалуй, главная практическая ценность фреймворка. Решённая один раз задача не исчезает — Webwright экспортирует успешный сценарий как параметризованный CLI-инструмент, готовый к повторному запуску.
С июля 2026 это формализовано в отдельный модуль Skill Factory: каждое решение оставляет после себя проверенный скрипт-навык, который перезапускается без единого обращения к модели, за считаные секунды и без токенов. На WebArena переиспользование таких навыков поднимает точность на отложенных задачах с 55% до 70%.
Для вайбкодера это значит одно: не обязательно каждый раз гонять дорогую модель. Собрал библиотеку из 5+ готовых инструментов под свою нишу — и дешёвая модель начинает решать задачи почти на уровне более крупной.

Как установить плагин Webwright для Claude Code и Codex?
Установка занимает две команды: pip install и playwright install chromium. Плагин для Claude Code добавляется отдельно через маркетплейс.
Требуется Python 3.10 или новее и ключ API от OpenAI, Anthropic или OpenRouter — фреймворк не привязан к конкретной модели, он задаёт только структуру цикла.
Порядок действий:
- Клонировать репозиторий и поставить пакет в editable-режиме:
pip install -e . - Установить браузерный движок:
playwright install chromium - Запустить задачу напрямую через CLI либо импортировать
Agentкак библиотеку в свой код - Для интеграции внутрь Claude Code установить плагин командой
/plugin install webwright@webwright— после этого Webwright появляется как слэш-команда внутри уже существующей сессии, без отдельного рантайма
Такие же манифесты плагинов есть для OpenAI Codex, OpenClaw и Hermes Agent. С мая 2026 добавился режим Task2UI: агент не просто решает задачу, а собирает результат в HTML-страницу, которую можно сразу открыть и переиспользовать.

Сильные и слабые стороны Webwright
Сильные стороны:
- Минималистичная кодовая база (около 1500 строк), которую реально прочитать за один вечер и понять целиком, без скрытой оркестрации
- Артефакт после каждого запуска — не мёртвая сессия браузера, а рабочий код, логи и скриншоты, которые можно перезапустить
- Гейт самопроверки снижает число ложных "готово" — агент физически не может закрыть задачу без прогона финального скрипта в чистой папке
- Функция сравнения траекторий (trajectory diff) показывает, на каком именно шаге разошлись успешный и провальный запуск
- Skill Factory превращает решённые задачи в бесплатные повторные вызовы без модели
Слабые стороны:
- Это исследовательский проект, а не готовый коммерческий продукт с поддержкой и SLA
- GPT-5.4 стабильно опережает Claude Opus 4.7 на простых и средних задачах, а на самых длинных сценариях преимущество переходит к Opus — под конкретную задачу придётся тестировать обе модели
- Итоговая стоимость запуска зависит от цены токенов выбранной модели, и она может ощутимо вырасти на длинных траекториях
- Написание кода вместо кликов предполагает, что модель действительно уверенно генерирует Playwright-селекторы — на нетипичной вёрстке точность может проседать
Максим: «Я уверен полностью, что языки программирования вообще не нужно изучать. Нейросети обучены на 80+ языках. Нужно погружаться в архитектуру: фронт, бэк, база данных.»
Кому подходит Webwright в 2026 году?
Webwright подходит разработчикам и вайбкодерам, которые уже строят агентные пайплайны на Claude Code, Codex или OpenClaw и хотят автоматизировать повторяющиеся браузерные задачи.
Если задача разовая и простая — открыть сайт, кликнуть кнопку — разницы почти нет, любой браузерный агент справится. Но там, где сценарий повторяется десятками раз: мониторинг цен, сбор данных с форм, регулярные проверки на 136+ реальных сайтах, терминальный подход себя окупает за счёт переиспользуемых скриптов. Новичку без опыта работы с терминалом и API-ключами будет сложнее: MIT-лицензия и открытый код не заменяют документацию продукта уровня SaaS.

Глоссарий терминов из статьи
- Code-as-action — подход, при котором агент выражает свои действия не отдельными кликами, а исполняемым кодом
- Online-Mind2Web — бенчмарк на 300 живых задачах на 136 сайтах с автоматической оценкой через LLM-судью
- Odysseys — бенчмарк долгих browsing-сценариев со средней длиной инструкции 272 слова
- Premature done gate — механизм, который не даёт агенту объявить задачу выполненной без финальной самопроверки
- Context compaction — периодическое сжатие истории действий агента в краткое summary
- Skill Factory — модуль, превращающий решённые задачи в переиспользуемые навыки без повторных вызовов модели

Частые вопросы про Webwright
Webwright — это официальный продукт Microsoft?
Нет, это исследовательский open-source проект Microsoft Research под MIT-лицензией, а не коммерческий сервис с поддержкой.
Сколько строк кода в Webwright?
Около 1500 строк в трёх модулях: цикл агента, Playwright-окружение и CLI, без сложной оркестрации сверху.
Какая модель лучше работает с Webwright, GPT-5.4 или Claude Opus 4.7?
GPT-5.4 сильнее в общем зачёте Online-Mind2Web (86,7% против 84,7%), но на самых сложных многошаговых задачах Opus 4.7 обходит его (80,5% против 76,6%) и тратит меньше шагов на решение.
Можно ли использовать Webwright с локальной моделью?
Да, фреймворк принимает ключи OpenAI, Anthropic или OpenRouter, а через OpenRouter доступны и локальные модели без привязки к одному провайдеру.
Нужно ли уметь программировать, чтобы пользоваться Webwright?
Базовое знакомство с терминалом и Python пригодится, но сами Playwright-скрипты пишет модель — от пользователя требуется в основном настройка окружения и формулировка задачи.
Чем Webwright отличается от Skill Factory?
Skill Factory — это модуль внутри Webwright, добавленный в июле 2026: он сохраняет решённые задачи как готовые к перезапуску скрипты без обращения к модели.
Работает ли Webwright внутри Claude Code?
Да, через официальный плагин, который добавляется командой /plugin install webwright@webwright и работает как слэш-команда в уже открытой сессии.
Если вы уже строите агентные пайплайны и хотите разобраться, какой инструмент даст максимум пользы под вашу задачу, посмотрите каталог AI-инструментов VibeCoderz или запишитесь на консультацию к Максиму.
Обновлено: август 2026.