AI агент для обработки документов достает данные из PDF, сканов и фото счетов, раскладывает их по полям с числом уверенности (confidence score) и отправляет спорные случаи на проверку человеку, а не действует вслепую. Ниже разберем архитектуру такого…
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
AI агент для обработки документов достает данные из PDF, сканов и фото счетов, раскладывает их по полям с числом уверенности (confidence score) и отправляет спорные случаи на проверку человеку, а не действует вслепую. Ниже разберем архитектуру такого агента, честные цены на парсинг в 2026 году и на чем его реально собрать: от n8n до связки Cursor и Claude Code.

В 2026 году агент для документов строится на связке парсинга (OCR или мультимодальная модель), извлечения полей со structured output и очереди human-in-the-loop для полей с низкой уверенностью. Цена обработки одной страницы у LlamaParse начинается от $0.00375 на простом тарифе. Ниже: архитектура, таблица цен и порог confidence score для старта.
Агент сначала классифицирует файл по MIME-типу и качеству, а затем выбирает маршрут: обычный текстовый слой парсится напрямую, а сканы и рукописный текст уходят через OCR-ноду или мультимодальную модель.
Разница в подходах решает все. Классический нод «extract from file» в n8n вытаскивает голый текст из читаемого PDF и полностью пасует на сканах и рукописном тексте, возвращая пустоту. Community-ноды вроде Unstract или API LlamaParse строят на том же документе разметку по колонкам и таблицам через LLM, а не по пикселям.

Прикинь, разница ощутима на живых счетах. Ролик про парсинг счетов на community-ноде Unstract показывает три типа документов: обычный, отсканированный вкривь и рукописный. Обычный нод n8n не дал вообще ничего на двух последних, а Unstract вытянул сумму, номер счета и дату даже с рукописного бланка. Для фото и PNG чаще берут связку Google Drive + Tesseract.js, для PDF, где важна структура таблиц, лучше заходит LlamaParse или встроенная мультимодальность Gemini.
Таблицы и построчные позиции извлекают через structured output: заранее описанную схему полей, которую модель обязана заполнить без выдумывания лишних значений.
Библиотека Pydantic плюс модель с поддержкой изображений вроде Gemini Flash превращают счет в валидный JSON за один вызов API, без промежуточного текстового слоя. Задаешь класс InvoiceData с вложенным массивом Item, и модель обязана вернуть именно эту структуру.
На практике здесь и рождается основная польза агента для бухгалтерии или закупок: не просто текст счета, а таблица позиций с ценой, количеством и суммой по каждой строке, готовая лечь в базу. В одном из разобранных воркфлоу n8n цепочка LLM сначала достает шапку счета: номер, дату, поставщика, итог, а затем отдельным вызовом парсит массив line items и связывает каждую строку с ID исходного документа в Airtable. Разделение на два шага снижает число ошибок на длинных таблицах: модели проще держать в голове пять полей шапки, чем пятнадцать строк сразу.

Для не самых сложных документов подойдет даже DeepSeek V3.2: дешево, и reasoning-версия неплохо справляется со структурированием уже распарсенного markdown, хотя и работает заметно медленнее топовых моделей.
Confidence score — число от 0 до 1 на каждое извлеченное поле, показывающее, насколько модель уверена в значении. Низкий score не значит ошибку, но значит: смотри руками.
Box Extract присваивает баллу метку Low, Medium или High и получает его агрегацией нескольких прогонов модели с проверкой на согласованность. Чем чаще независимые запуски сходятся в одном значении, тем выше итоговый score поля.
Один прогон и красивое число на выходе, если честно, доверия не заслуживают. Более надежный способ, который используют в мультиагентных пайплайнах обработки документов: гонять одно поле несколько раз параллельно и вычислять confidence из процента совпадений, а не брать самооценку модели на веру. Поля, где ответы разошлись, автоматически помечаются для ручной проверки, а не проскакивают с фиктивно высоким числом.

| Уровень confidence | Что происходит с полем |
|---|---|
| Выше 90-95% | Уходит дальше по процессу автоматически |
| 60-90% | Попадает в очередь human-in-the-loop |
| Ниже 60% | Помечается как «требует ручного ввода», не как ошибка |
| Поле отсутствует в документе | Отдельная ветка missing-data, не общая очередь проверки |
Порог confidence score это рычаг, который решает, сколько документов дойдет до человека. Слишком высокий порог пропускает ошибки, слишком низкий заваливает очередь и превращает проверку в штамповку.
Стэнфордский Enterprise AI Playbook 2026 года сравнивает два подхода: когда человек проверяет каждый вывод агента (approval model) и когда агент работает автономно, а человек разбирает только исключения (escalation model). Вторая схема в среднем дает рост производительности 71%, против 30% у первой, именно потому что внимание человека тратится точечно.
Стартовый порог для документов обычно берут в районе 80-85% и затем подгоняют под реальную нагрузку команды: если ревьюер разбирает 500 документов в день, а в очередь падает 2000, порог явно занижен. Хороший интерфейс проверки показывает не голое число, а сам фрагмент документа рядом со значением, чтобы человек не читал файл заново, а просто подтверждал или правил одно поле.

Лиза: «Раньше на разбор 15-20 видео для одной контентной единицы уходило часов четыре руками. Написала скрипт в Google Таблицах: вставляешь ссылки, он сам транскрибирует и раскладывает по 15 критериям. Сейчас это 5,5 минут, а я просто проверяю финальную выжимку, а не читаю все подряд».
Тот же принцип работает и с документами: агент берет на себя рутинный разбор, а человек проверяет только то, что реально сомнительно.
Для no-code сборки без единой строчки кода берут n8n с HTTP-нодами к LlamaParse или Gemini. Для кастомной логики со схемами Pydantic и своим API удобнее писать на Python в Cursor или через терминал Claude Code.
Выбор зависит от того, куда агент должен встроиться. Если нужна связка с готовыми Google Drive, Google Sheets и Telegram без деплоя отдельного сервиса, n8n закрывает 90% задачи визуальными нодами. Если агент часть более крупного продукта с собственным API и базой, быстрее написать сервис на Python или TypeScript с нуля, а Cursor и Claude Code просто ускоряют написание кода вокруг Pydantic-схем и обработки ошибок API.

На старте многие вайбкодеры вообще совмещают подходы: прототип и первую проверку гипотезы собирают в n8n за вечер, а после того как схема полей стабилизировалась, переносят логику в код, потому что self-hosted версия дает контроль над лимитами и логами. Каталог с описанием обоих инструментов и типовых сценариев смотри в https://vibecoderz.ru/ide, там же сравнение похожих IDE для вайбкодинга.
Цена зависит от сложности парсинга и модели извлечения: от центов за страницу на простом тарифе до $0.02 за страницу на агентном разборе сложных таблиц и сканов.
LlamaParse считает стоимость в кредитах: 1000 кредитов стоят $1.25, простой тариф Fast берет 1 кредит за страницу, а тариф Cost-effective с базовой LLM уже 3 кредита. Новым аккаунтам дают 10 000 бесплатных кредитов в месяц, этого хватает примерно на несколько тысяч простых документов для теста гипотезы.

| Сервис / модель | Ориентировочная цена | Когда выбирать |
|---|---|---|
| LlamaParse Fast | ~$0.00125 за страницу | Простые читаемые PDF без сложных таблиц |
| LlamaParse Cost-effective | ~$0.00375 за страницу | Средняя сложность, есть таблицы |
| LlamaParse Agentic extract | ~$0.01875 за страницу | Сложные сканы, рукописный текст, много таблиц |
| Gemini 3.1 Pro (мультимодальный вызов) | $2 / $12 за 1M токенов | Большие пакеты документов, нужен большой контекст |
| Claude Sonnet 4.6 | $3 / $15 за 1M токенов | Сложная логика извлечения и валидации между полями |
| DeepSeek V3.2 | $0.28 / $0.42 за 1M токенов | Дешевое структурирование уже распарсенного текста |
Итоговая цена почти всегда складывается из двух шагов: парсинг документа в markdown или изображение, а затем отдельный вызов модели на извлечение полей. Экономить на первом шаге за счет дешевого OCR, если документы сложные, обычно себе дороже: ошибка на входе тянет за собой ошибку в каждом извлеченном поле.
Главные ошибки: доверие сырому confidence score без проверки калибровки, отсутствие консенсуса между несколькими прогонами и статичный порог, который никто не пересматривает после запуска.
Порог, выставленный один раз и забытый, со временем перестает работать, потому что модели дрейфуют, а состав входящих документов меняется. Стоит проверять процент документов, уходящих на ручную проверку, хотя бы раз в неделю, а не полагаться на цифру, зафиксированную на старте.
Вторая частая ошибка: просить модель извлечь сразу двадцать полей одним вызовом на длинном документе. Точность падает именно там, где схема раздута. Разбивка на отдельные вызовы под шапку документа и под построчные позиции таблицы, как в примере с Airtable выше, обычно поднимает итоговую точность заметнее, чем смена модели на более дорогую.
Третья: молчаливое отбрасывание пустых полей вместо явной пометки «отсутствует в документе». Пустое значение и низкая уверенность в существующем значении требуют разной реакции агента, и смешивать их в одну очередь на проверку не стоит.

Для старта без написания кода достаточно n8n с HTTP-нодами к LlamaParse или Unstract плюс Google Sheets или Airtable как хранилище. Для более гибкой логики валидации между полями берут Python-скрипт с Pydantic-схемой и вызовом Gemini или Claude напрямую через API, а Cursor и Claude Code ускоряют написание и отладку такого кода.
Если задача плотно завязана на бухгалтерию, закупки или юридические документы, стоит присмотреться к готовым нишевым агентам под конкретную профессию, а не собирать все с нуля: каталог таких решений на https://vibecoderz.ru/agents обновляется еженедельно и покрывает больше 90 профессий.
Чем AI-агент для документов отличается от обычного OCR? OCR просто переводит пиксели в текст без понимания смысла. Агент дополнительно понимает структуру, достает нужные поля по схеме и присваивает каждому confidence score.
Можно ли обойтись без human-in-the-loop валидации? Для внутренних черновых задач да. Для платежей, договоров и налоговой отчетности риск ошибки слишком дорогой, поэтому часть полей стоит выводить на проверку человеком.
Что делать, если confidence score модели врет? Проверять калибровку на своих документах. Прогони один документ несколько раз и посмотри на разброс ответов, а не только на итоговое число.
Какой порог confidence score ставить для старта? Большинство команд стартуют с 80-85% и подгоняют порог под то, сколько документов реально успевает разобрать ревьюер за день.
Нужен ли программист, чтобы собрать такого агента? Нет. Базовую версию собирают в n8n или через прямые вызовы API моделей вроде Gemini без единой строчки классического кода.
Сколько стоит обработать тысячу документов через AI-агента? От пары долларов на простых читаемых PDF с дешевой моделью до пары десятков долларов на сложных сканах и рукописном тексте с агентным разбором.
Какие модели лучше справляются с таблицами в PDF? Мультимодальные модели вроде Gemini и Claude справляются с таблицами и рукописным текстом заметно лучше классического OCR, потому что видят структуру страницы, а не только текст.
Если тема AI-агентов для документов близка вашей задаче, посмотрите обзоры инструментов в каталоге https://vibecoderz.ru/ide или напишите Максиму напрямую на консультацию: https://t.me/maxnagovitsyn.
Обновлено: июль 2026.