Нейросеть, которая сама кликает по браузеру и открывает приложения на компьютере, уже не демо ради хайпа, а рабочая технология 2026 года. Она называется по-разному: browser agent, computer use agent, просто "агент для браузера". В статье разберем, че…
400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
Нейросеть, которая сама кликает по браузеру и открывает приложения на компьютере, уже не демо ради хайпа, а рабочая технология 2026 года. Она называется по-разному: browser agent, computer use agent, просто "агент для браузера". В статье разберем, чем эти категории отличаются друг от друга и от старой доброй RPA, что реально умеет Anthropic Computer Use, куда делся OpenAI Operator и почему даже лучший агент на бенчмарке OSWorld 2.0 доводит до конца лишь каждую пятую задачу.
Coротко: в 2026 году агент для браузера и Computer Use — это разные по охвату категории. Первый работает только с сайтами через структуру страницы, второй управляет всей операционной системой через скриншоты. Anthropic вывел Computer Use и новый Browser Use tool в общий доступ 20 августа 2026 года, а OpenAI Operator к этому моменту уже дважды сменил название и форму.
Browser agent — это модель, которая видит страницу, сама решает следующее действие и адаптируется, если интерфейс изменился. RPA-робот просто повторяет записанную последовательность кликов по координатам.
Ключевая разница в понимании задачи. RPA записывает макрос: клик в точку (340, 120), ввод текста, клик в точку (500, 340). Стоит разработчикам сайта переставить кнопку — и робот ломается. Browser agent анализирует структуру страницы или скриншот заново на каждом шаге и подбирает действие под текущее состояние экрана.
Здесь же появляется agent loop, цикл, вокруг которого построены практически все современные browser agent. Модель делает скриншот или разбирает DOM (это структура кода страницы), анализирует, что на ней есть, планирует действие, выполняет его через клик или ввод текста, затем оценивает результат и запускает цикл заново. Именно поэтому агент способен восстановиться после всплывающего окна или страницы с ошибкой 404, а RPA-робот в такой ситуации просто зависает.
Для задач внутри браузера, заполнение форм, парсинг сайтов, работа с веб-сервисами без API, чаще выгоднее не универсальный агент, а специализированный инструмент вроде Playwright. Он работает со структурой страницы напрямую, быстрее и дешевле по токенам. Подробнее о том, чем сама RPA отличается от агентного подхода, разбирали в отдельной статье про роботизированную автоматизацию процессов.

Computer Use — категория более широкая, чем browser agent. Модель управляет не только сайтом, а всей операционной системой: открывает приложения, переключает окна, работает с файлами.
Разница простая. Browser agent живет внутри вкладки. Computer Use смотрит на весь рабочий стол через скриншот и решает, куда кликнуть мышью, как это делал бы человек. Ему без разницы, что перед ним: почтовый клиент, редактор, GarageBand или файловый менеджер, лишь бы у приложения был графический интерфейс.
Из транскриптов курса про AI-агентов видно, что перцепция может идти тремя путями: полный скриншот с визуальным анализом, подсчет пикселей для точного позиционирования курсора и визуальные маркеры, когда модель сама размечает на картинке кнопки и поля ввода. Четвертый способ, анализ кода страницы, применим только в браузере. На практике зрелые агенты комбинируют подходы: DOM там, где есть доступ к разметке, скриншот там, где его нет.
Плата за такую универсальность — токены. Скриншот весит на порядок больше, чем текст разметки страницы, а значит каждый шаг цикла обходится дороже. Поэтому Computer Use имеет смысл включать, когда задача реально выходит за пределы браузера, а не как замену специализированному инструменту.

Claude управляет экраном через скриншоты и координаты клика, а с 20 августа 2026 года к этому добавился отдельный Browser Use tool, который читает структуру страницы вместо пикселей.
Anthropic вывел Computer Use, новый Browser Use tool, Skills API и Files API в общий доступ на Claude Platform 20 августа 2026 года. Browser Use за один вызов теперь читает не только картинку, но и структуру страницы, поэтому действует по конкретному полю или кнопке, а не по координате на экране. Ранние пользователи из early access получили на 20-40% меньше циклов на одну задачу, а значит быстрее и дешевле.
Практика запуска у разработчиков одинаковая: не на основном компьютере, а в песочнице. Anthropic с самого начала настаивала на контейнеризации, будь то Docker с локальным хостом или облачная виртуальная машина. У модели есть доступ к инструменту bash и к текстовому редактору, а системный промпт можно кастомизировать под конкретную задачу, от бронирования до работы с документами. По опыту тестов из транскриптов курса Anthropic, агент чаще всего спотыкается на всплывающих окнах и незнакомом языке интерфейса, а иногда просто упирается в лимит запросов.
Claude Code на портале мы разбирали отдельно: там же смотрите, как вообще выглядит агентная работа с кодом у Anthropic, вне контекста именно Computer Use — обзор Claude Code.

Operator запустили в январе 2025 как отдельный продукт, но уже 31 августа 2025 его закрыли и слили в ChatGPT Agent. В августе 2026 пропал и ChatGPT Agent - его заменили на Work и облачный браузер.
Показательная история для всех, кто планирует строить процессы вокруг одного конкретного бренда агента. Operator стартовал с доступом только для подписчиков ChatGPT Pro, показывал на демо бронирование стола через OpenTable, покупки продуктов через Instacart и билеты через StubHub, набрал 38,1% на бенчмарке OSWorld и 58,1% на WebArena. Меньше через год продукт закрыли, а его возможности перенесли внутрь ChatGPT под названием agent mode.
История на этом не закончилась. В начале августа 2026 OpenAI без предупреждения убрала agent mode из ChatGPT и в справочном центре указала пользователям переходить на ChatGPT Work для многошаговых задач и на облачный браузер для веб-задач. Разработчики в форуме OpenAI жаловались, что ни один из инструментов не покрывает старый функционал целиком: Work не умеет работать с сайтами, где нужен логин, а часть сценариев из презентации Operator просто выпала.
Вывод для читателя, который выбирает инструмент под конкретную задачу сегодня: у Anthropic сейчас стабильный, документированный и только что переведенный в GA продукт. У OpenAI за полтора года три смены названия и архитектуры без миграционного гайда. Это не значит, что второй хуже по качеству, но означает более высокий риск, что интеграция сломается без предупреждения.

На OSWorld лучшие агенты уже обгоняют человека, но на длинных многошаговых задачах OSWorld 2.0 показывает completion всего 20,6%. Разрыв между простыми и длинными задачами - главная цифра в теме Computer Use.
Динамика впечатляет на бумаге. В апреле 2024 года лучший агент решал 12,2% задач OSWorld, весной 2026 года Claude Opus 4.7 и Sonnet 4.6 впервые превысили человеческий базовый уровень в 72,4%. Но в июне 2026 года вышел OSWorld 2.0, набор из 108 длинных сценариев, где медианная задача занимает у человека 1,6 часа. На нем тот же Claude Opus 4.8 с максимальным thinking и батчингом инструментов справился лишь с 20,6% задач при частичном скоре 54,8%, а GPT-5.5 остановился около 13%.
Разница между двумя цифрами и есть честная картина 2026 года. Короткие однозначные задачи, найти файл, кликнуть кнопку, заполнить форму, агенты решают на уровне человека или лучше. Длинные задачи с промежуточными состояниями, где нужно удержать контекст на протяжении часа реальной работы, спросить пользователя вместо угадывания и проверить результат, все еще проваливаются в трех случаях из четырех.
| Категория | Что делает | Токены | Когда выбрать |
|---|---|---|---|
| RPA | Повторяет записанные координаты кликов | Низкие | Стабильный интерфейс, задача не меняется годами |
| Browser agent (Playwright + AI) | Читает структуру страницы, адаптируется | Средние | Работа только с сайтами и веб-сервисами |
| Computer Use / Browser Use | Управляет всей ОС через скриншот или доступ к разметке | Высокие | Десктопные приложения без API, смешанные задачи |

Главных риска два: prompt-инъекции через содержимое страницы и деструктивные действия без подтверждения. Обе проблемы решаются песочницей и человеком в цикле.
У Computer Use нет разделения между инструкцией пользователя и данными, которые агент видит на экране. Если на открытой странице спрятан текст с командой, модель может воспринять его как часть задачи. Это prompt-инъекция, и в контексте Computer Use она опаснее, чем в обычном чате: агент способен не просто ответить неправильно, а удалить файл или отправить форму.
Практических мер защиты по факту две. Первая — работать не на основной машине, а в контейнере или виртуальной машине, полностью изолированной от личных и рабочих данных. Вторая — consent gate, то есть человек в цикле: агент не продолжает действие, требующее подтверждения (оплата, отправка данных, необратимое удаление), пока пользователь явно не одобрит шаг. Обе рекомендации совпадают у Anthropic и у независимых разработчиков, которые уже строят продакшн-агентов на Computer Use.
Лиза: «Раньше я вручную разбирала 15-20 видео для одной контентной единицы. Написала скрипт: вставляешь ссылки, дальше сам делает транскрибацию и разбор по 15 критериям. Было 4 часа, стало 5,5 минут.»
Это не Computer Use в чистом виде, а агентная автоматизация данных, но принцип тот же: агент берет на себя рутинный цикл действий, а человек проверяет результат и подключается там, где нужно решение.

Если задача ограничена браузером, дешевле и надежнее взять browser agent, построенный на структуре страницы. Computer Use оправдан, когда задача выходит за пределы браузера в десктопные приложения без API.
Практический критерий выбора укладывается в один вопрос: остается ли задача внутри вкладки браузера. Парсинг сайтов, заполнение форм, работа с личным кабинетом сервиса, все это решается специализированным browser agent быстрее и без риска ошибиться при клике по пикселю не туда. Подробный разбор такого сценария смотрите в статье про AI-агент для парсинга сайтов без бана и исков.
Computer Use включаем, когда нужного API нет и задача реально пересекает границу браузера: заполнить локальный редактор, переключить системную настройку, скомбинировать работу нескольких десктопных приложений в одном сценарии. На демо OpenAI Computer Use в 2025 году показывали именно такие сценарии, запуск GarageBand с настройкой записи звука и переключение темы оформления macOS, задачи, которые ни один browser agent физически не решит.

Чем browser agent отличается от RPA простыми словами?
RPA повторяет заранее записанные клики по координатам и ломается при любом изменении интерфейса. Browser agent на каждом шаге заново анализирует страницу и подбирает действие под текущее состояние, поэтому переживает мелкие изменения дизайна.
Computer Use и browser agent - это одно и то же?
Нет. Browser agent работает только с сайтами внутри браузера. Computer Use управляет всей операционной системой: любыми приложениями, файловой системой, настройками, не только веб-страницами.
OpenAI Operator еще существует в 2026 году?
Как отдельный продукт нет. Его закрыли 31 августа 2025 года и перенесли в ChatGPT Agent, а в августе 2026 года OpenAI убрала и agent mode, заменив его на ChatGPT Work и облачный браузер.
Можно ли доверять Computer Use для платежей и важных операций без присмотра?
Нет, и сама Anthropic это прямо не рекомендует. Для действий с необратимыми последствиями нужен consent gate: агент останавливается и ждет подтверждения человека перед оплатой, отправкой формы или удалением данных.
Какой у Computer Use реальный процент успешных задач?
На коротких задачах OSWorld лучшие модели уже обгоняют человека. На длинных многошаговых сценариях OSWorld 2.0 фиксирует completion около 20,6% у лучшего агента, так что для сложных многочасовых процессов технология пока не готова к работе без контроля.
Нужен ли Docker для запуска Computer Use дома?
Формально нет, но и Anthropic, и независимые разработчики настойчиво рекомендуют контейнеризацию или виртуальную машину, чтобы агент не имел доступа к личным файлам и паролям на основной машине.
Чем отличается новый Browser Use tool от старого Computer Use у Anthropic?
Browser Use читает структуру страницы и действует по конкретному элементу, а не по координате на экране. Это быстрее и надежнее для веб-задач, тогда как Computer Use остается универсальным инструментом для всей операционной системы.

Обновлено: август 2026.
Полный каталог AI-инструментов для вайбкодинга смотрите в каталоге VibeCoderz, а если нужно разобрать конкретный сценарий с агентами под ваш проект, пишите Максиму на консультацию в Telegram.