AI агент для обработки документов достает данные из PDF, сканов и фото счетов, раскладывает их по полям с числом уверенности (confidence score) и отправляет спорные случаи на проверку человеку, а не действует вслепую. Ниже разберем архитектуру такого агента, честные цены на парсинг в 2026 году и на чем его реально собрать: от n8n до связки Cursor и Claude Code.

В 2026 году агент для документов строится на связке парсинга (OCR или мультимодальная модель), извлечения полей со structured output и очереди human-in-the-loop для полей с низкой уверенностью. Цена обработки одной страницы у LlamaParse начинается от $0.00375 на простом тарифе. Ниже: архитектура, таблица цен и порог confidence score для старта.
Как AI-агент отличает скан от нормального PDF?
Агент сначала классифицирует файл по MIME-типу и качеству, а затем выбирает маршрут: обычный текстовый слой парсится напрямую, а сканы и рукописный текст уходят через OCR-ноду или мультимодальную модель.
Разница в подходах решает все. Классический нод «extract from file» в n8n вытаскивает голый текст из читаемого PDF и полностью пасует на сканах и рукописном тексте, возвращая пустоту. Community-ноды вроде Unstract или API LlamaParse строят на том же документе разметку по колонкам и таблицам через LLM, а не по пикселям.

Прикинь, разница ощутима на живых счетах. Ролик про парсинг счетов на community-ноде Unstract показывает три типа документов: обычный, отсканированный вкривь и рукописный. Обычный нод n8n не дал вообще ничего на двух последних, а Unstract вытянул сумму, номер счета и дату даже с рукописного бланка. Для фото и PNG чаще берут связку Google Drive + Tesseract.js, для PDF, где важна структура таблиц, лучше заходит LlamaParse или встроенная мультимодальность Gemini.
Как вытащить таблицы и позиции из счета в JSON?
Таблицы и построчные позиции извлекают через structured output: заранее описанную схему полей, которую модель обязана заполнить без выдумывания лишних значений.
Библиотека Pydantic плюс модель с поддержкой изображений вроде Gemini Flash превращают счет в валидный JSON за один вызов API, без промежуточного текстового слоя. Задаешь класс InvoiceData с вложенным массивом Item, и модель обязана вернуть именно эту структуру.
На практике здесь и рождается основная польза агента для бухгалтерии или закупок: не просто текст счета, а таблица позиций с ценой, количеством и суммой по каждой строке, готовая лечь в базу. В одном из разобранных воркфлоу n8n цепочка LLM сначала достает шапку счета: номер, дату, поставщика, итог, а затем отдельным вызовом парсит массив line items и связывает каждую строку с ID исходного документа в Airtable. Разделение на два шага снижает число ошибок на длинных таблицах: модели проще держать в голове пять полей шапки, чем пятнадцать строк сразу.

Для не самых сложных документов подойдет даже DeepSeek V3.2: дешево, и reasoning-версия неплохо справляется со структурированием уже распарсенного markdown, хотя и работает заметно медленнее топовых моделей.
Что такое confidence score и как ему верить?
Confidence score — число от 0 до 1 на каждое извлеченное поле, показывающее, насколько модель уверена в значении. Низкий score не значит ошибку, но значит: смотри руками.
Box Extract присваивает баллу метку Low, Medium или High и получает его агрегацией нескольких прогонов модели с проверкой на согласованность. Чем чаще независимые запуски сходятся в одном значении, тем выше итоговый score поля.
Один прогон и красивое число на выходе, если честно, доверия не заслуживают. Более надежный способ, который используют в мультиагентных пайплайнах обработки документов: гонять одно поле несколько раз параллельно и вычислять confidence из процента совпадений, а не брать самооценку модели на веру. Поля, где ответы разошлись, автоматически помечаются для ручной проверки, а не проскакивают с фиктивно высоким числом.

| Уровень confidence | Что происходит с полем |
|---|---|
| Выше 90-95% | Уходит дальше по процессу автоматически |
| 60-90% | Попадает в очередь human-in-the-loop |
| Ниже 60% | Помечается как «требует ручного ввода», не как ошибка |
| Поле отсутствует в документе | Отдельная ветка missing-data, не общая очередь проверки |
Как работает human-in-the-loop без раздутой очереди на проверку?
Порог confidence score это рычаг, который решает, сколько документов дойдет до человека. Слишком высокий порог пропускает ошибки, слишком низкий заваливает очередь и превращает проверку в штамповку.
Стэнфордский Enterprise AI Playbook 2026 года сравнивает два подхода: когда человек проверяет каждый вывод агента (approval model) и когда агент работает автономно, а человек разбирает только исключения (escalation model). Вторая схема в среднем дает рост производительности 71%, против 30% у первой, именно потому что внимание человека тратится точечно.
Стартовый порог для документов обычно берут в районе 80-85% и затем подгоняют под реальную нагрузку команды: если ревьюер разбирает 500 документов в день, а в очередь падает 2000, порог явно занижен. Хороший интерфейс проверки показывает не голое число, а сам фрагмент документа рядом со значением, чтобы человек не читал файл заново, а просто подтверждал или правил одно поле.

Лиза: «Раньше на разбор 15-20 видео для одной контентной единицы уходило часов четыре руками. Написала скрипт в Google Таблицах: вставляешь ссылки, он сам транскрибирует и раскладывает по 15 критериям. Сейчас это 5,5 минут, а я просто проверяю финальную выжимку, а не читаю все подряд».
Тот же принцип работает и с документами: агент берет на себя рутинный разбор, а человек проверяет только то, что реально сомнительно.
Cursor или Claude Code: где собирать такого агента?
Для no-code сборки без единой строчки кода берут n8n с HTTP-нодами к LlamaParse или Gemini. Для кастомной логики со схемами Pydantic и своим API удобнее писать на Python в Cursor или через терминал Claude Code.
Выбор зависит от того, куда агент должен встроиться. Если нужна связка с готовыми Google Drive, Google Sheets и Telegram без деплоя отдельного сервиса, n8n закрывает 90% задачи визуальными нодами. Если агент часть более крупного продукта с собственным API и базой, быстрее написать сервис на Python или TypeScript с нуля, а Cursor и Claude Code просто ускоряют написание кода вокруг Pydantic-схем и обработки ошибок API.

На старте многие вайбкодеры вообще совмещают подходы: прототип и первую проверку гипотезы собирают в n8n за вечер, а после того как схема полей стабилизировалась, переносят логику в код, потому что self-hosted версия дает контроль над лимитами и логами. Каталог с описанием обоих инструментов и типовых сценариев смотри в https://vibecoderz.ru/ide, там же сравнение похожих IDE для вайбкодинга.
Сколько стоит обработать тысячу документов в 2026 году?
Цена зависит от сложности парсинга и модели извлечения: от центов за страницу на простом тарифе до $0.02 за страницу на агентном разборе сложных таблиц и сканов.
LlamaParse считает стоимость в кредитах: 1000 кредитов стоят $1.25, простой тариф Fast берет 1 кредит за страницу, а тариф Cost-effective с базовой LLM уже 3 кредита. Новым аккаунтам дают 10 000 бесплатных кредитов в месяц, этого хватает примерно на несколько тысяч простых документов для теста гипотезы.

| Сервис / модель | Ориентировочная цена | Когда выбирать |
|---|---|---|
| LlamaParse Fast | ~$0.00125 за страницу | Простые читаемые PDF без сложных таблиц |
| LlamaParse Cost-effective | ~$0.00375 за страницу | Средняя сложность, есть таблицы |
| LlamaParse Agentic extract | ~$0.01875 за страницу | Сложные сканы, рукописный текст, много таблиц |
| Gemini 3.1 Pro (мультимодальный вызов) | $2 / $12 за 1M токенов | Большие пакеты документов, нужен большой контекст |
| Claude Sonnet 4.6 | $3 / $15 за 1M токенов | Сложная логика извлечения и валидации между полями |
| DeepSeek V3.2 | $0.28 / $0.42 за 1M токенов | Дешевое структурирование уже распарсенного текста |
Итоговая цена почти всегда складывается из двух шагов: парсинг документа в markdown или изображение, а затем отдельный вызов модели на извлечение полей. Экономить на первом шаге за счет дешевого OCR, если документы сложные, обычно себе дороже: ошибка на входе тянет за собой ошибку в каждом извлеченном поле.
Какие ошибки чаще всего убивают точность агента?
Главные ошибки: доверие сырому confidence score без проверки калибровки, отсутствие консенсуса между несколькими прогонами и статичный порог, который никто не пересматривает после запуска.
Порог, выставленный один раз и забытый, со временем перестает работать, потому что модели дрейфуют, а состав входящих документов меняется. Стоит проверять процент документов, уходящих на ручную проверку, хотя бы раз в неделю, а не полагаться на цифру, зафиксированную на старте.
Вторая частая ошибка: просить модель извлечь сразу двадцать полей одним вызовом на длинном документе. Точность падает именно там, где схема раздута. Разбивка на отдельные вызовы под шапку документа и под построчные позиции таблицы, как в примере с Airtable выше, обычно поднимает итоговую точность заметнее, чем смена модели на более дорогую.
Третья: молчаливое отбрасывание пустых полей вместо явной пометки «отсутствует в документе». Пустое значение и низкая уверенность в существующем значении требуют разной реакции агента, и смешивать их в одну очередь на проверку не стоит.

Стек для сборки агента на июль 2026
Для старта без написания кода достаточно n8n с HTTP-нодами к LlamaParse или Unstract плюс Google Sheets или Airtable как хранилище. Для более гибкой логики валидации между полями берут Python-скрипт с Pydantic-схемой и вызовом Gemini или Claude напрямую через API, а Cursor и Claude Code ускоряют написание и отладку такого кода.
Если задача плотно завязана на бухгалтерию, закупки или юридические документы, стоит присмотреться к готовым нишевым агентам под конкретную профессию, а не собирать все с нуля: каталог таких решений на https://vibecoderz.ru/agents обновляется еженедельно и покрывает больше 90 профессий.
Глоссарий
- OCR (optical character recognition) — технология распознавания текста по изображению пикселей, без понимания смысла и структуры документа.
- Structured output — режим работы модели, при котором ответ обязан соответствовать заранее заданной схеме полей, а не быть свободным текстом.
- Confidence score — число от 0 до 1, отражающее уверенность модели в конкретном извлеченном значении поля.
- Human-in-the-loop — архитектура, при которой часть решений агента проверяется человеком, а не выполняется полностью автономно.
- Agentic parsing — разбор документа моделью, которая рассуждает о визуальной структуре страницы, а не просто конвертирует пиксели в текст.
- Pydantic — Python-библиотека для описания и валидации структуры данных, часто используется как схема для structured output.
- Line items — построчные позиции в счете или накладной: количество, цена, сумма по каждой строке отдельно.
Часто задаваемые вопросы про AI-агента для документов
Чем AI-агент для документов отличается от обычного OCR? OCR просто переводит пиксели в текст без понимания смысла. Агент дополнительно понимает структуру, достает нужные поля по схеме и присваивает каждому confidence score.
Можно ли обойтись без human-in-the-loop валидации? Для внутренних черновых задач да. Для платежей, договоров и налоговой отчетности риск ошибки слишком дорогой, поэтому часть полей стоит выводить на проверку человеком.
Что делать, если confidence score модели врет? Проверять калибровку на своих документах. Прогони один документ несколько раз и посмотри на разброс ответов, а не только на итоговое число.
Какой порог confidence score ставить для старта? Большинство команд стартуют с 80-85% и подгоняют порог под то, сколько документов реально успевает разобрать ревьюер за день.
Нужен ли программист, чтобы собрать такого агента? Нет. Базовую версию собирают в n8n или через прямые вызовы API моделей вроде Gemini без единой строчки классического кода.
Сколько стоит обработать тысячу документов через AI-агента? От пары долларов на простых читаемых PDF с дешевой моделью до пары десятков долларов на сложных сканах и рукописном тексте с агентным разбором.
Какие модели лучше справляются с таблицами в PDF? Мультимодальные модели вроде Gemini и Claude справляются с таблицами и рукописным текстом заметно лучше классического OCR, потому что видят структуру страницы, а не только текст.
Если тема AI-агентов для документов близка вашей задаче, посмотрите обзоры инструментов в каталоге https://vibecoderz.ru/ide или напишите Максиму напрямую на консультацию: https://t.me/maxnagovitsyn.
Обновлено: июль 2026.