Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
🎯 О чём этот конспект: Практический разбор новой функции Computer Use в ChatGPT, позволяющей языковой модели напрямую взаимодействовать с интерфейсом операционной системы macOS/Windows. Разбираются 5 реальных сценариев автоматизации (от поиска дизайн-референсов и монтажа в Premiere Pro до UX-тестирования и управления iPhone), когда у целевых сервисов полностью отсутствуют API или MCP-интеграции.
👤 Кому будет полезно: Вайбкодерам, AI-инженерам, фаундерам микро-SaaS, видеомейкерам и разработчикам автоматизаций, желающим делегировать рутинные задачи агентам интерфейсного уровня.
✨ Что получите: Пошаговые алгоритмы запуска UI-агентов, точные промпты для работы с софтом без API, методы экономии контекстного окна и матрицу принятия решений «MCP/CLI против Computer Use».
1. Сбор визуальных референсов и трансформация в дизайн без API
Контекст: Дизайнеры и вайбкодеры часто сталкиваются с закрытыми веб-платформами для вдохновения (например, Savee), у которых нет публичных API или MCP-серверов для выгрузки контента. На бесплатных тарифах такие сервисы ограничивают скроллинг и выгрузку, что делает классический парсинг невозможным без написания кастомных скриптов обхода. ChatGPT Computer Use решает эту проблему за счет эмуляции действий человека: модель открывает браузер, скроллит страницу, находит подходящие референсы и передает их в генератор изображений. Это позволяет соединить закрытый сайт-источник с внешним AI-генератором за один промпт. В связке с генеративным сервисом Higgsfield агент автоматически вытягивает визуальную эстетику и создает готовые дизайн-макеты.
Тайминг:[00:39], [01:12], [01:36]
Выгода: Экономия от 30 до 45 минут на ручном серчинге, скачивании картинок и формулировании промптов для графических нейросетей.
Как применить:
Шаг 1: Формулирование комплексного промпта — ChatGPT Browser — Откройте сессию Computer Use и задайте целевой сайт, критерии поиска и интеграцию с генератором.
Hey there, I want you to shoot over to savee.it (save.com) and find for me three posters that look gorgeous by searching for "dashboards". And then, once you've done that, I want you to go ahead and use my Higgsfield connection to generate three alternatives for something to do with English Springer Spaniels based on the captured design essence.
Шаг 2: Верификация перехвата стилистики — Higgsfield AI — Дождитесь, пока агент извлечет типографику, цветовую гамму и композицию найденных постеров, после чего проконтролируйте генерацию в Higgsfield.
Результат: Получены 3 оригинальных графических постера, созданных по композиционным паттернам референсов с закрытого сайта без использования платных API.
2. Автономный видеомонтаж в Adobe Premiere Pro и генерация B-Roll
Контекст: Профессиональные десктопные программы для продакшена (Premiere Pro, After Effects, Photoshop) исторически изолированы от прямого взаимодействия с LLM из-за отсутствия гибких официальных интеграций. Монтажеру приходится вручную прослушивать таймлайн, выгружать таймкоды, переходить в Midjourney/Runway, скачивать ролики и импортировать их обратно в проект. Computer Use устраняет этот барьер: агент находит файл на локальном рабочем столе, запускает тяжелое приложение, анализирует звуковую дорожку и определяет ключевую фразу. Затем агент параллельно обращается к модели генерации видео (Seed Dance 2.5 через Higgsfield CLI) и физически перетаскивает готовый B-roll футаж на таймлайн программы.
Тайминг:[02:53], [03:34], [04:03], [04:42]
Выгода: Сокращение времени создания чернового видеомонтажа с динамическими B-roll перебивками с 1 часа до 3–4 минут без ручного кликанья по таймлайну.
Как применить:
Шаг 1: Подключение генератора через MCP/CLI — Higgsfield CLI — Настройте доступ к генерации видео через интерфейс CLI в конфигурации агента.
# Подключение Higgsfield CLI / MCP в терминале или конфигуратореnpx higgsfield-cli login
Шаг 2: Запуск автономного монтажа — ChatGPT Computer Use — Передайте агенту инструкции по управлению Premiere Pro и интеграции перебивки.
Hey there, I want you to open up Premiere Pro. I want you to load in the video I have saved on my desktop named "GPT6 Astra". I want you to identify a moment in the first 10 to 15 seconds of the video, generate and insert a 5-second B-roll using Higgsfield video generation (Seed Dance 2.5), and then let me know when that's done so I can review it.
Шаг 3: Контроль размещения на таймлайне — Premiere Pro — Агент самостоятельно спозиционирует курсор на фразе-триггере, создаст дополнительный видеослой и вставит сгенерированный MP4-файл.
Результат: Смонтированный черновик в Premiere Pro с автоматически спозиционированным B-roll роликом, точно попадающим в смысловой контекст звуковой дорожки.
3. Человекоподобное UX-тестирование и выявление точек трения (Friction Points)
Контекст: Традиционные синтетические автотесты (Selenium, Playwright, Cypress) проверяют только наличие селекторов и HTTP-статусы, но не способны оценить реальный пользовательский опыт. Команды разработки часто упускают очевидные UX-барьеры, например, когда кнопка «Скачать бесплатно» ведет на длинную форму регистрации вместо прямой отдачи дистрибутива. Computer Use дает возможность запустить агента в режиме «наивного пользователя»: нейросеть получает бизнес-цель и исследует сайт через визуальный браузер. В процессе навигации агент документирует логические ошибки в воронке, неочевидную навигацию и баги верстки.
Тайминг:[05:50], [06:40], [07:12]
Выгода: Мгновенный аудит конверсионной воронки продуктового лендинга без привлечения дорогих UX-исследователей и фокус-групп.
Hey there. I want you to head over to glider.com in your browser and I want you to just download the app. Stop there and give me any feedback on that user journey from a user's perspective.
Шаг 2: Анализ логов интерфейсного агента — ChatGPT Logs — Отследите действия курсора модели: поиск CTA-кнопки, реакцию на всплывающие модальные окна и переходы между разделами.
Шаг 3: Сбор отчета по UX-барьерам — Отчет агента — Получите перечень замечаний. Например: «CTA "Download for free" перенаправляет на страницу создания аккаунта вместо начала загрузки файла, что создает барьер входа».
Результат: Детализированный отчет об ошибках пользовательского интерфейса и сценарии загрузки продукта с точки зрения нового посетителя.
4. Визуальный контекстный веб-девелопмент и интеграция ассетов
Контекст: При верстке сайтов вайбкодерам часто требуется подобрать графику, которая идеально сочетается с существующей цветовой схемой, типографикой и композицией блоков. Обычный процесс генерации через чат требует ручной выгрузки скриншотов, составления длинных промптов с описанием стилистики и последующей правки CSS-кода для позиционирования. Сочетая визуальный осмотр сайта через Computer Use и генератор изображений, модель самостоятельно оценивает свободное пространство в UI, генерирует аватар нужного стиля и интегрирует его в разметку футера. Агент «видит» верстку и принимает решение о компоновке на основе дизайна живой страницы.
Тайминг:[07:36], [08:20], [08:46]
Выгода: Устранение разрыва между генерацией контента и его фактической интеграцией в кодовую базу интерфейса.
Как применить:
Шаг 1: Постановка задачи анализа и генерации — ChatGPT — Передайте URL проекта и контекст задачи.
Hey there, this is a website I've got: [URL]. I want you to have a quick look through that website and find a way to integrate an image of me. Grab my profile photo, generate a variation with a different background using Higgsfield that matches the design cadence of the page, place it down in the footer, and give me dynamic feedback on why you positioned it there.
Шаг 2: Оценка баланса страницы — UI Inspector — Агент проверяет отступы, контрастность фона и сетку страницы, подбирая фоновое окружение на портрете под тон макета.
Шаг 3: Автоматическое внедрение кода — Code Editor — Модель обновляет HTML/CSS страницы, вставляя сгенерированный ассет в выбранное место.
Результат: Гармонично вписанный в дизайн сайта графический ассет, сгенерированный и вставленный в макет без ручной работы в графических редакторах.
5. Управление мобильными приложениями через iPhone Mirroring
Контекст: Большинство популярных мобильных платформ (Instagram, TikTok, банковские клиенты) либо вообще не имеют открытых API для аналитики, либо закрывают доступ к детализированным метрикам удержания аудитории (например, досмотры на 3-й секунде). Доступ к этим данным возможен только с экрана мобильного телефона. Благодаря связке macOS Sequoia (функция iPhone Mirroring) и Computer Use в ChatGPT, агент получает доступ к экрану смартфона прямо на десктопе. Модель способна открывать мобильные приложения, переходить в разделы закрытой статистики, скроллить списки и выгружать аналитические инсайты без нарушения правил платформы.
Тайминг:[09:31], [10:20], [10:45]
Выгода: Полная автоматизация сбора мобильной аналитики и парсинга данных из нативных приложений iOS без реверс-инжиниринга и приватных API.
Как применить:
Шаг 1: Активация зеркалирования экрана — macOS — Запустите системное приложение iPhone Mirroring на Mac и убедитесь, что смартфон разблокирован и отображается в окне.
Шаг 2: Отправка инструкций агенту — ChatGPT Computer Use — Сформулируйте задачу по сбору статистики из мобильного клиента.
Using the iPhone Mirroring app on my Mac, open Instagram, go to my profile analytics for the last month, check the 3-second viewer retention stats and audience insights, and summarize any observations or areas for improvement.
Шаг 3: Обработка результатов — Чат — Агент эмулирует клики и свайпы по виртуальному экрану смартфона, находит нужные графики и формирует итоговую сводку в чате.
Результат: Извлеченные из закрытого мобильного интерфейса метрики и аналитические выводы, полученные без использования официального Graph API.
6. Матрица выбора инструментов и контроль расхода токенов
Контекст: Computer Use — ресурсоемкая технология. Каждое действие агента требует создания скриншота экрана, отправки его в контекст мультимодальной LLM, распознавания координат и генерации системного события. Если запускать UI-агента для задач, которые можно решить через терминал или API, бюджет на токены будет исчерпан за считанные минуты. Кроме того, длинные контекстные цепочки вызывают деградацию внимания модели. Для эффективной работы необходимы строгая логика выбора инструментов и гигиена контекстных окон: изоляция одной задачи в рамках одной сессии и использование UI-агента исключительно как «моста последней мили».
Тайминг:[09:04], [10:56]
Выгода: Снижение затрат на API/токены в 5–10 раз и исключение зацикливания агента в интерфейсе.
Как применить:
Шаг 1: Проверка по дереву решений — Применяйте трехуровневый фильтр перед запуском задачи:
Действительно ли задачу нужно автоматизировать? (Если нет — сделать руками за 10 секунд).
Можно ли решить задачу через CLI или MCP? (Если да — используйте CLI/MCP, так как это в разы быстрее, надежнее и дешевле).
Если API/CLI отсутствуют, а интерфейс закрыт — подключайте Computer Use.
Шаг 2: Изоляция контекста — ChatGPT — Всегда завершайте сессию после успешного выполнения задачи. Не нагромождайте новые запросы в тот же чат — открывайте новое окно для следующего процесса, чтобы сбросить накопленную историю скриншотов.
[Потребность в задаче]
│
▼
[Есть CLI / MCP?] ─── ДА ───► Запуск через Terminal / MCP Server (Быстро, дёшево)
│
НЕТ
▼
[Запуск Computer Use] ──────► Управление UI через скриншоты (Мост последней мили)
Результат: Оптимизированный процесс автоматизации с минимальным потреблением контекстного окна и максимальной надежностью выполнения.
FAQ
В: Насколько быстро работает ChatGPT Computer Use по сравнению с первыми версиями подобных агентов? О: Скорость кратно увеличилась. Если ранние версии Claude Computer Use требовали долгого ожидания между действиями (автор шутит, что успел отрастить усы за время теста), то ChatGPT взаимодействует с элементами интерфейса практически мгновенно, совершая серии действий за секунды.
В: Нужен ли API-ключ от сервиса, если я использую Computer Use? О: Нет, в этом заключается фундаментальное преимущество интерфейсного управления. Агент взаимодействует с программами и сайтами через визуальный слой (GUI), так же как человек, используя мышь и клавиатуру.
В: В чем главное отличие использования MCP/CLI от Computer Use? О: MCP и CLI работают напрямую с кодом и протоколами: это быстрее, стабильнее и расходует значительно меньше токенов. Computer Use следует применять только тогда, когда у приложения нет CLI, API или MCP-сервера.
В: Как контролировать расход токенов при управлении компьютером? О: Главное правило — одна задача на одну сессию. Не ведите длинные диалоги в окне с Computer Use, так как каждый интерфейсный шаг добавляет тяжелые скриншоты в контекст. Завершили задачу — открывайте новый чат.
В: Безопасно ли давать ChatGPT доступ к мобильному банку или соцсетям через iPhone Mirroring? О: Необходимо проявлять осторожность. Модель выполняет команды в реальном интерфейсе вашего устройства. Не оставляйте агента без присмотра при работе с конфиденциальными данными и финансовыми сервисами.
В: Какие модели генерации медиа лучше подключать к агенту? О: В видео автор использует экосистему Higgsfield (в частности, модель Seed Dance 2.5 для видео), так как она легко подключается через CLI/MCP и обеспечивает высокое качество генерации.
Ресурсы и ссылки
Higgsfield AI — платформа для генерации фото и видео с подключением через CLI/MCP — упомянут в видео
Glider (glider.com) — сервис голосовой диктовки и транскрипции, стартап автора — упомянут в видео
Savee (save.com / savee.it) — платформа для поиска визуальных референсов и дизайн-вдохновения — упомянут в видео
Adobe Premiere Pro — профессиональный видеоредактор, автоматизированный через UI-агента — упомянут в видео
iPhone Mirroring — встроенная утилита macOS Sequoia для трансляции и управления экраном iPhone — упомянут в видео
Конспект создан на основе видео «GPT can now control your computer like never before» канала Jack AI. Все права на оригинальный материал принадлежат авторам.Источник: https://www.youtube.com/watch?v=j-FffQYiPCY