VibeCoderzVibeCoderz
Все статьи
2026/08/268 мин чтения

Webwright от Microsoft: SOTA фреймворк для браузерных агентов

Webwright — открытый фреймворк от Microsoft Research, который меняет саму механику браузерных агентов. Вместо того чтобы предсказывать следующий клик на странице, модель пишет и запускает Playwright-код в терминале, а браузерная сессия становится рас…

Содержание (10)+

Webwright — открытый фреймворк от Microsoft Research, который меняет саму механику браузерных агентов. Вместо того чтобы предсказывать следующий клик на странице, модель пишет и запускает Playwright-код в терминале, а браузерная сессия становится расходным материалом, который можно открыть и выбросить. Именно этот подход дал фреймворку лучший результат среди открытых решений на бенчмарке Online-Mind2Web.

Webwright — это терминальный фреймворк Microsoft Research (релиз 4 мая 2026), где модель пишет Playwright-скрипты вместо пошаговых кликов. На Online-Mind2Web с GPT-5.4 фреймворк набирает 86,7%, на Odysseys — 60,1%. В статье: архитектура цикла, разбор бенчмарков, установка плагина для Claude Code и Codex, кому подходит инструмент.

Что такое Webwright и зачем Microsoft создала этот фреймворк?

Webwright — это исследовательский open-source фреймворк для браузерных агентов, который даёт модели терминал вместо привычного цикла "смотри на страницу, кликай, смотри снова".

Кодовая база занимает около 1500 строк в трёх модулях: цикл агента, окружение на Playwright и CLI, который их связывает. Никакой мультиагентной оркестрации, графов состояний или сложных архитектурных схем — всё построено на одном простом принципе, который GitHub-репозиторий проекта формулирует как идею "терминал — это всё, что нужно для веб-агентов".

Причина появления Webwright простая. Классические браузерные агенты держат один живой сеанс браузера и гадают следующее действие: клик, ввод текста, скролл. Каждая ошибка селектора тянет за собой следующую, а долгие задачи ломаются каскадом мелких сбоев. Webwright разрывает эту связку между агентом и сессией браузера, и это меняет всё дальнейшее поведение системы.

Изображение

Чем Webwright отличается от обычных браузерных агентов?

Обычный агент предсказывает клики по живой странице и хранит состояние в браузере. Webwright пишет код, запускает и выбрасывает сессии, а хранит состояние в рабочей директории — коде, скриншотах и логах.

Разница на практике ощутимая. Мы в VibeCoderz уже разбирали похожий по духу инструмент, Browser Use — там агент тоже управляет браузером, но действует пошагово, через прямое предсказание клика по элементу. Webwright устроен иначе: он пишет полноценный скрипт с Playwright-селекторами, точно так же, как это делает разработчик-человек, а не гадает следующий пиксель.

Отсюда практическое преимущество. Скрипт можно переиспользовать и параметризовать: подставить другую дату, другой город, другой товар. Пошаговый агент каждый раз заново проходит одну и ту же логику с нуля, даже если задача почти идентична предыдущей.

Изображение

Как устроен цикл работы Webwright изнутри?

Цикл состоит из четырёх шагов: контекст модели, код от модели, выполнение в терминале, проверка результата. Он повторяется, пока агент не пройдёт собственную самопроверку.

Раннер передаёт модели контекст: задачу, текущее состояние рабочей директории и последние наблюдения. Модель в ответ выдаёт блок рассуждения и bash-команду, часто с небольшим Playwright-скриптом внутри. Окружение выполняет команду и возвращает вывод терминала, логи или трейс ошибки, если что-то пошло не так. Дальше агент либо уточняет подход, либо завершает задачу.

Здесь есть важный нюанс, который Microsoft Research описывает в своей статье как решение двух главных проблем открытых bash-действий: преждевременное "готово" и переполнение контекста. Прежде чем система примет задачу как завершённую, агент обязан сгенерировать финальный скрипт, прогнать его в чистой пустой папке, сохранить логи и вынести собственный вердикт успех или провал.

По сути, модель заставляют перепроверить свою же домашнюю работу с нуля. А чтобы длинные траектории не выжирали контекст, история сжимается в единое summary каждые 20 шагов.

Изображение

Какие результаты Webwright показывает на бенчмарках Online-Mind2Web и Odysseys?

На Online-Mind2Web (300 задач, 136 сайтов) Webwright с GPT-5.4 набирает 86,7% — лучший результат среди открытых решений. На Odysseys, бенчмарке долгих сценариев, результат 60,1% против прежнего максимума 44,5%.

Цифры стоит смотреть в паре, потому что модели ведут себя по-разному. Claude Opus 4.7 через Webwright набирает 84,7% в общем зачёте Online-Mind2Web, но на самых сложных задачах (11 и более шагов) он обходит GPT-5.4: 80,5% против 76,6% при бюджете в 100 шагов. Причём Opus решает задачи в среднем за 21,9 шага, тогда как GPT-5.4 тратит 26,3 шага — при том что стоит токен у Opus дороже.

МетрикаWebwright + GPT-5.4Webwright + Claude Opus 4.7
Online-Mind2Web (общий)86,7%84,7%
Online-Mind2Web (hard, N=100)76,6%80,5%
Odysseys (долгие сценарии)60,1%
Средние шаги на задачу26,321,9

На Odysseys, где инструкции в среднем занимают 272 слова, а задачи растянуты на десятки шагов, прежний максимум держал Claude Opus 4.6 с показателем 44,5%, используя классический подход с постоянным браузером и предсказанием координат. Webwright с GPT-5.4 поднимает планку до 60,1% — это на 35,1% выше прежнего рекорда и на 26,6 процентных пункта выше базовой версии самого GPT-5.4 (33,5%) без терминального подхода.

Изображение

Работает ли Webwright с небольшими моделями вроде Qwen?

Да. Небольшая модель Qwen3.5-9B, дополненная готовой библиотекой инструментов, набирает 66,2% на сложном сплите Online-Mind2Web — почти догоняя флагманов.

Тут кроется, пожалуй, главная практическая ценность фреймворка. Решённая один раз задача не исчезает — Webwright экспортирует успешный сценарий как параметризованный CLI-инструмент, готовый к повторному запуску.

С июля 2026 это формализовано в отдельный модуль Skill Factory: каждое решение оставляет после себя проверенный скрипт-навык, который перезапускается без единого обращения к модели, за считаные секунды и без токенов. На WebArena переиспользование таких навыков поднимает точность на отложенных задачах с 55% до 70%.

Для вайбкодера это значит одно: не обязательно каждый раз гонять дорогую модель. Собрал библиотеку из 5+ готовых инструментов под свою нишу — и дешёвая модель начинает решать задачи почти на уровне более крупной.

Изображение

Как установить плагин Webwright для Claude Code и Codex?

Установка занимает две команды: pip install и playwright install chromium. Плагин для Claude Code добавляется отдельно через маркетплейс.

Требуется Python 3.10 или новее и ключ API от OpenAI, Anthropic или OpenRouter — фреймворк не привязан к конкретной модели, он задаёт только структуру цикла.

Порядок действий:

  1. Клонировать репозиторий и поставить пакет в editable-режиме: pip install -e .
  2. Установить браузерный движок: playwright install chromium
  3. Запустить задачу напрямую через CLI либо импортировать Agent как библиотеку в свой код
  4. Для интеграции внутрь Claude Code установить плагин командой /plugin install webwright@webwright — после этого Webwright появляется как слэш-команда внутри уже существующей сессии, без отдельного рантайма

Такие же манифесты плагинов есть для OpenAI Codex, OpenClaw и Hermes Agent. С мая 2026 добавился режим Task2UI: агент не просто решает задачу, а собирает результат в HTML-страницу, которую можно сразу открыть и переиспользовать.

Изображение

Сильные и слабые стороны Webwright

Сильные стороны:

  • Минималистичная кодовая база (около 1500 строк), которую реально прочитать за один вечер и понять целиком, без скрытой оркестрации
  • Артефакт после каждого запуска — не мёртвая сессия браузера, а рабочий код, логи и скриншоты, которые можно перезапустить
  • Гейт самопроверки снижает число ложных "готово" — агент физически не может закрыть задачу без прогона финального скрипта в чистой папке
  • Функция сравнения траекторий (trajectory diff) показывает, на каком именно шаге разошлись успешный и провальный запуск
  • Skill Factory превращает решённые задачи в бесплатные повторные вызовы без модели

Слабые стороны:

  • Это исследовательский проект, а не готовый коммерческий продукт с поддержкой и SLA
  • GPT-5.4 стабильно опережает Claude Opus 4.7 на простых и средних задачах, а на самых длинных сценариях преимущество переходит к Opus — под конкретную задачу придётся тестировать обе модели
  • Итоговая стоимость запуска зависит от цены токенов выбранной модели, и она может ощутимо вырасти на длинных траекториях
  • Написание кода вместо кликов предполагает, что модель действительно уверенно генерирует Playwright-селекторы — на нетипичной вёрстке точность может проседать
Максим: «Я уверен полностью, что языки программирования вообще не нужно изучать. Нейросети обучены на 80+ языках. Нужно погружаться в архитектуру: фронт, бэк, база данных.»

Кому подходит Webwright в 2026 году?

Webwright подходит разработчикам и вайбкодерам, которые уже строят агентные пайплайны на Claude Code, Codex или OpenClaw и хотят автоматизировать повторяющиеся браузерные задачи.

Если задача разовая и простая — открыть сайт, кликнуть кнопку — разницы почти нет, любой браузерный агент справится. Но там, где сценарий повторяется десятками раз: мониторинг цен, сбор данных с форм, регулярные проверки на 136+ реальных сайтах, терминальный подход себя окупает за счёт переиспользуемых скриптов. Новичку без опыта работы с терминалом и API-ключами будет сложнее: MIT-лицензия и открытый код не заменяют документацию продукта уровня SaaS.

Изображение

Глоссарий терминов из статьи

  • Code-as-action — подход, при котором агент выражает свои действия не отдельными кликами, а исполняемым кодом
  • Online-Mind2Web — бенчмарк на 300 живых задачах на 136 сайтах с автоматической оценкой через LLM-судью
  • Odysseys — бенчмарк долгих browsing-сценариев со средней длиной инструкции 272 слова
  • Premature done gate — механизм, который не даёт агенту объявить задачу выполненной без финальной самопроверки
  • Context compaction — периодическое сжатие истории действий агента в краткое summary
  • Skill Factory — модуль, превращающий решённые задачи в переиспользуемые навыки без повторных вызовов модели
Изображение

Частые вопросы про Webwright

Webwright — это официальный продукт Microsoft?
Нет, это исследовательский open-source проект Microsoft Research под MIT-лицензией, а не коммерческий сервис с поддержкой.

Сколько строк кода в Webwright?
Около 1500 строк в трёх модулях: цикл агента, Playwright-окружение и CLI, без сложной оркестрации сверху.

Какая модель лучше работает с Webwright, GPT-5.4 или Claude Opus 4.7?
GPT-5.4 сильнее в общем зачёте Online-Mind2Web (86,7% против 84,7%), но на самых сложных многошаговых задачах Opus 4.7 обходит его (80,5% против 76,6%) и тратит меньше шагов на решение.

Можно ли использовать Webwright с локальной моделью?
Да, фреймворк принимает ключи OpenAI, Anthropic или OpenRouter, а через OpenRouter доступны и локальные модели без привязки к одному провайдеру.

Нужно ли уметь программировать, чтобы пользоваться Webwright?
Базовое знакомство с терминалом и Python пригодится, но сами Playwright-скрипты пишет модель — от пользователя требуется в основном настройка окружения и формулировка задачи.

Чем Webwright отличается от Skill Factory?
Skill Factory — это модуль внутри Webwright, добавленный в июле 2026: он сохраняет решённые задачи как готовые к перезапуску скрипты без обращения к модели.

Работает ли Webwright внутри Claude Code?
Да, через официальный плагин, который добавляется командой /plugin install webwright@webwright и работает как слэш-команда в уже открытой сессии.


Если вы уже строите агентные пайплайны и хотите разобраться, какой инструмент даст максимум пользы под вашу задачу, посмотрите каталог AI-инструментов VibeCoderz или запишитесь на консультацию к Максиму.

Обновлено: август 2026.

All Posts

Автор

Елисавета Наговицына
Елисавета Наговицына

Предприниматель · Контент-маркетолог · SEO-стратег · AI-продуктолог

2026/08/26

400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28