ScrapeGraph AI собирает данные с сайтов через граф из шагов, где часть узлов — обычный код, а часть — LLM, которая понимает содержимое страницы по смыслу. Сайт меняет верстку, а логика извлечения продолжает работать, потому что модель ищет цену или название товара, а не заранее заданный CSS-селектор. Ниже разберем архитектуру, сравним с классическим скрейпингом и покажем рабочий граф на практике.
ScrapeGraph AI — открытая Python-библиотека (27 000+ звезд на GitHub, MIT-лицензия) и облачный API с тарифами от бесплатного до $500 в месяц. В статье: как читать граф ScrapeGraph, чем он лучше CSS-селекторов при редизайне сайта, пример графа для карточки товара и минимальная установка на Python.
Как устроена графовая архитектура ScrapeGraph AI?
ScrapeGraph AI использует ту же логику узлов и переходов, что и LangGraph — только применительно к скрейпингу: технические шаги и шаги с LLM связаны в единый граф выполнения.
Каждый узел графа делает одну задачу: загружает страницу, определяет ее тип или извлекает конкретное поле через LLM. Переходы между узлами зависят от результата предыдущего шага — примерно так же, как в LangGraph, только там граф ведет диалог агента, а тут — процесс сбора данных.
Если вы уже читали про LangGraph на VibeCoderz, концепцию узлов и переходов объяснять заново не будем — тут та же модель, просто цель другая. ScrapeGraph появился в 2024 году благодаря итальянской команде (Марко Винчигуэрра, Марко Перини, Лоренцо Падоан), выросшей из открытой библиотеки на LangChain в полноценную платформу с облачным API. Разработчики называют три готовых типа пайплайнов из коробки: SmartScraperGraph для одной страницы, SearchGraph для нескольких результатов поиска и SpeechGraph для аудио-вывода. Каждый — это заранее собранный граф, который остается только сконфигурировать под задачу.

Почему графовый подход надежнее CSS-селекторов при редизайне сайта?
Классический скрейпер ломается при любом изменении верстки, потому что селектор жестко завязан на структуру HTML. Узел с LLM в графе ScrapeGraph интерпретирует страницу по смыслу и переживает редизайн без правок кода.
Beautiful Soup и похожие инструменты требуют точного пути до элемента: класс, тег, порядковый номер в дереве DOM. Сайт обновил дизайн — путь сломался, скрипт падает, разработчик снова открывает инспектор кода. При объеме в сотни целевых сайтов это превращается в постоянную работу по поддержке парсеров, а не разовую настройку.
LLM-узел получает инструкцию вида «найди цену товара на странице» и ищет это значение по контексту, а не по фиксированному пути в разметке. Расположение блока с ценой может измениться хоть завтра — результат не изменится. Это и есть ключевое отличие AI-скрейпинга от традиционного: устойчивость к изменениям встроена в архитектуру, а не держится на ручной поддержке. Плата за такую устойчивость — цена LLM-вызова, поэтому в реальных пайплайнах узлы с моделью обычно комбинируют с обычными техническими шагами там, где путь и так стабилен.

Как выглядит граф для извлечения данных о товаре на практике?
Типовой граф для карточки товара: загрузка страницы → определение ее типа → LLM-извлечение полей → проверка схемы. Каждый узел решает одну задачу и передает результат дальше.
Возьмем задачу «собрать название и цену со страницы товара на маркетплейсе». Граф из четырех узлов справляется без единой строчки под конкретный сайт:
- Узел загрузки страницы — получает HTML или рендерит JavaScript через Playwright, если сайт динамический.
- Узел определения типа страницы — карточка товара это или страница категории с списком. От ответа зависит, какой узел запустится следующим.
- Узел LLM-извлечения — для карточки товара просит модель вернуть название, цену и характеристики в заданной JSON-схеме.
- Узел валидации — проверяет, что извлеченные поля соответствуют ожидаемой структуре, прежде чем передать результат дальше по пайплайну.
Такая ветвящаяся логика — как раз то, ради чего берут граф, а не линейный скрипт сверху вниз: на разных типах страниц выполняются разные шаги, и это не костыль через десяток if-else, а часть архитектуры.
Лиза: «Раньше на разбор 15-20 видео для одной статьи уходило часов 4 вручную. Написала скрипт с автоматической обработкой по критериям — теперь 5,5 минуты. Та же логика: не сидеть и вручную парсить, а собрать пайплайн один раз и гонять его на автомате».

Сколько стоит ScrapeGraph AI и как его установить?
Открытая библиотека бесплатна и требует своей инфраструктуры. Облачный API работает по кредитам: от бесплатных 500 до 750 000 в месяц на тарифе Pro за $500.
По состоянию на сентябрь 2026 у ScrapeGraph AI четыре тарифных плана: Free — 500 кредитов, Starter — 10 000 кредитов за $20 в месяц, Growth — 100 000 кредитов за $100, Pro — 750 000 кредитов за $500. Базовый scrape стоит 1 кредит, extract с LLM-полями — 5 кредитов за вызов, поиск — 2-5 кредитов за результат в зависимости от того, нужен ли prompt-based разбор.
Открытая библиотека устанавливается локально:
pip install scrapegraphai
# обязательно для рендеринга страниц с JS
playwright installМинимальный граф на Python занимает около десятка строк — вы просто связываете готовые типы узлов вместо того, чтобы писать логику каждого шага с нуля. Для проектов без своей инфраструктуры под прокси и антибот-защиту логичнее облачный API: там ротация прокси, обход Cloudflare и рендеринг JS уже настроены на стороне сервиса через Playwright.

Библиотека или облачный API — что выбрать?
Библиотека дает полный контроль и подходит для self-hosted сценариев с локальными моделями. Облачный API снимает с разработчика заботу об анти-бот защите и прокси, но работает по кредитам.
| Критерий | Открытая библиотека | Облачный API |
|---|---|---|
| Стоимость | Бесплатно, платите только за LLM-вызовы | От $0 до $500/мес по кредитам |
| Anti-bot и прокси | Настраиваете сами | Встроены на стороне сервиса |
| Рендеринг JS | Нужен свой Playwright | Уже настроен |
| Локальные модели | Поддерживает Ollama и другие | Только облачные провайдеры |
| Подходит для | Self-hosted, разработчиков с своей инфраструктурой | Быстрого старта, продакшена без DevOps |
Если у вас уже есть прокси-пул и вы хотите гонять локальную модель через Ollama ради экономии, библиотека выигрывает по деньгам на масштабе. Если задача — быстро получить структурированные данные без настройки инфраструктуры, облачный API окупает разницу в цене временем, которое не тратится на поддержку.

Кому реально подходит ScrapeGraph AI?
Инструмент рассчитан на тех, кто пишет код: разработчиков, вайбкодеров и агентов на связке с LangGraph. Готовых визуальных интерфейсов для нетехнических пользователей внутри библиотеки нет.
Для вайбкодеров, которые уже собирают пайплайны через промпты в Claude Code или Cursor, ScrapeGraph закрывает конкретную задачу — устойчивый сбор данных без ручной поддержки селекторов при каждом обновлении целевого сайта. Разработчики получают Python SDK и JS/TS SDK для встраивания в существующие пайплайны. Для мониторинга цен, конкурентного анализа или сбора данных под RAG-системы граф отрабатывает как обычный шаг в более крупном агентном сценарии — например, вместе с Firecrawl для конвертации страниц в чистый markdown или для задач по автоматизации Wildberries и Ozon.
Новичкам без опыта в Python инструмент скорее не подойдет — тут нужно писать код или хотя бы читать документацию SDK. Если задача — просто выгрузить таблицу с сайта без единой строчки кода, проще смотреть в сторону no-code скрейперов с готовым интерфейсом.

Глоссарий
- Граф (в контексте скрейпинга) — последовательность узлов и переходов, где каждый узел выполняет один шаг, а следующий шаг зависит от результата предыдущего.
- LLM-узел — шаг графа, где модель интерпретирует содержимое страницы по смысловому описанию, а не по жесткому селектору.
- CSS-селектор — путь до элемента в HTML-дереве (класс, тег, порядок), который классический скрейпер использует для поиска данных.
- SmartScraperGraph — готовый одностраничный пайплайн ScrapeGraph AI: prompt + источник на входе, структурированные данные на выходе.
- Playwright — библиотека для управления браузером, которую ScrapeGraph использует для рендеринга страниц с JavaScript.
Часто задаваемые вопросы
Что такое ScrapeGraph AI простыми словами?
Это инструмент, который собирает данные с сайтов через связку графа шагов и языковой модели. Вместо жесткого пути до элемента вы описываете словами, что нужно извлечь, а граф решает, как это сделать на конкретной странице.
Чем ScrapeGraph AI отличается от Beautiful Soup?
Beautiful Soup ищет данные по точному пути в HTML и ломается при редизайне сайта. ScrapeGraph использует LLM-узел, который понимает содержимое по смыслу и переживает изменения верстки без правок кода.
Можно ли использовать ScrapeGraph AI бесплатно?
Да, открытая библиотека scrapegraphai бесплатна, вы платите только за вызовы выбранной LLM. У облачного API есть бесплатный тариф на 500 кредитов в месяц для тестов.
Нужны ли знания Python для работы с ScrapeGraph AI?
Да, это библиотека и SDK для разработчиков. Минимальный граф собирается из готовых узлов примерно за десяток строк кода, но базовое понимание Python нужно.
Как ScrapeGraph AI обходит защиту от ботов?
В открытой библиотеке ротацию прокси и обход анти-бот систем настраиваете сами. В облачном API это уже встроено на стороне сервиса через Playwright и внешние анти-бот сервисы.
Чем ScrapeGraph AI похож на LangGraph?
Оба используют одну архитектурную модель — граф из узлов и переходов. LangGraph применяет ее к диалогам и рассуждениям агента, ScrapeGraph — конкретно к задаче извлечения данных с сайтов.
Подходит ли ScrapeGraph AI для мониторинга цен конкурентов?
Да, это один из основных сценариев использования: граф с LLM-узлом устойчиво извлекает цену и название товара даже когда сайт конкурента меняет верстку карточки.
Если собираете свой data-пайплайн на графах и агентах, посмотрите каталог AI-инструментов VibeCoderz — там разобраны Claude Code, Cursor и другие инструменты для вайбкодинга. А если нужна помощь с архитектурой конкретного проекта — запишитесь на консультацию к Максиму.
Обновлено: сентябрь 2026.