RAG в n8n решает конкретную проблему: обычный AI Agent node отвечает только по данным своего обучения и забывает диалог, как только вы закрываете чат. Retrieval Augmented Generation добавляет агенту доступ к вашим документам через векторную базу, а отдельная memory-нода хранит историю переписки между сессиями. Вместе эти два блока превращают обычного чат-бота в ассистента с личной базой знаний, и собрать такую связку в n8n можно вообще без кода. Обновлено: август 2026. Ниже пошагово разберем, какую векторную базу выбрать, как загрузить документы, что писать в system prompt и как подключить память отдельно от RAG.
RAG-агент в n8n состоит из трех частей: AI Agent node, векторная база (Pinecone, Qdrant или Supabase pgvector) и memory-нода для истории диалога. Документы загружаются через Google Drive, режутся на чанки и превращаются в эмбеддинги. Базовая настройка занимает 2-4 часа, а тариф можно уложить в ноль рублей на старте.
Зачем AI-агенту в n8n нужна память и RAG?
Обычный AI Agent node в n8n отвечает только на основе данных обучения модели и забывает диалог после закрытия чата. RAG и memory-нода закрывают два разных пробела по отдельности.
Retrieval Augmented Generation, или RAG, означает поиск с дополненной генерацией. Агент сначала ищет релевантные фрагменты в векторной базе, а затем формирует ответ на их основе, а не просто угадывает по памяти обучения. Это единственный способ дать агенту доступ к вашим PDF, таблицам и транскриптам без дообучения самой модели.
У этой проблемы два разных лица, и путать их не стоит. Первое: агент ничего не знает про ваш бизнес, цены, регламенты, базу клиентов, записи созвонов. Второе: агент забывает, о чем вы говорили пять минут назад, если сессия собрана без памяти.
RAG решает первую проблему. Документы и таблицы загружаются в векторную базу, а агент обращается туда как к дополнительному инструменту, через vector store question answer tool.
Memory решает вторую. Window Buffer Memory или база вроде Postgres хранит историю сообщений по session ID, и агент помнит контекст диалога, даже если пользователь вернулся через час.

По факту в рабочем воркфлоу оба блока стоят рядом: RAG подключается как tool, memory - как отдельная сабнода агента. Без памяти агент с базой знаний все равно будет отвечать на каждый вопрос как в первый раз.
Из каких блоков состоит AI Agent node в n8n?
AI Agent node в n8n собирается из четырех сабнод: Chat Model, Memory, Tools и System Message. Каждая настраивается отдельно и подключается стрелкой к главному узлу агента.
AI Agent node в n8n построен на LangChain и работает не как обычная нода "вопрос-ответ", а как цикл рассуждения: модель решает, какой инструмент вызвать, интерпретирует результат и решает, продолжать поиск или отвечать. Это отличает его от простого узла генерации текста, который выдает ответ без выбора инструментов.

Chat Model - это мозг агента, языковая модель, которая читает запрос и решает, что делать. Для RAG-задач модель важна: слабая модель забывает, что нужно свериться с базой знаний, и начинает отвечать по памяти.
Вот какие модели реально ставить в n8n под RAG-агента на конец 2026 года:

| Модель | Цена за 1M токенов (input/output) | SWE-bench | Для чего в RAG-агенте |
|---|---|---|---|
| Claude Sonnet 4.6 | $3 / $15 | 79.6% | Универсальная чат-модель, хорошо следует system prompt |
| Gemini 3.1 Pro | $2 / $12 | 80.6% | Большие базы знаний, контекст до 1M токенов |
| GPT-5.4 | $2.5 / $15 | ~80% | Стабильный tool-calling, реже игнорирует базу |
| DeepSeek V3.2 | $0.28 / $0.42 | 72-74% | Дешевый вариант для простых FAQ-ботов |
Tools - это список того, что агент умеет вызывать: векторная база, HTTP-запрос, калькулятор, вызов другого воркфлоу. Vector Store подключается сюда как один из tools, с понятным названием и описанием, чтобы модель понимала, когда его вызывать. Если хочется не no-code, а собрать агента с нуля через код, посмотрите обзор Claude Code в каталоге, для RAG-пайплайнов его тоже используют.
Какую векторную базу выбрать для RAG в n8n?
Для старта без бюджета подходит Supabase с pgvector, бесплатно до 500 МБ. Pinecone удобнее для масштаба, но платный тариф начинается от 50 долларов в месяц уже сейчас.
По данным сравнения векторных баз за апрель 2026, Supabase pgvector остается бесплатным, пока база весит меньше 500 МБ, Qdrant Cloud дает бесплатный кластер на 1 ГБ навсегда, а Pinecone требует платный тариф от 50 долларов в месяц уже на старте. Для MVP RAG-агента в n8n этого хватит на многие месяцы.

У всех трех баз в n8n есть готовая нода: Pinecone, Qdrant и Postgres для Supabase. Разница не в возможностях поиска, а в том, что вы уже используете и сколько данных загружаете.
Если у вас уже есть Supabase под авторизацию или базу пользователей, добавить туда pgvector - это одна SQL-таблица, никакого нового сервиса. Если данных много и важна скорость поиска, Qdrant дает честный бесплатный кластер и стартовую программу со скидкой 20% на платный тариф. Pinecone проще в настройке для новичков, но бесплатного тарифа фактически не осталось: закладывайте от 50 долларов в месяц.
| База | Бесплатный тариф | Платный тариф | Подходит для |
|---|---|---|---|
| Supabase pgvector | До 500 МБ бесплатно | От $25/мес | MVP, если уже есть Supabase |
| Qdrant Cloud | 1 ГБ навсегда | От $10-65/мес | Скорость поиска, есть self-host опция |
| Pinecone | Практически отсутствует | От $50-70/мес | Простая настройка, большой масштаб |
Как загрузить документы в векторную базу через n8n?
Документы заливаются в базу через отдельный препроцессинг-воркфлоу: Google Drive, разбивка на чанки, эмбеддинги и вставка в векторную базу. Настраивается один раз, дальше файлы просто добавляются в папку.
Оптимальный chunk overlap для связности текста между кусками - около 250 символов, а начинать стоит с 3-4 файлов, чтобы освоить процесс перед масштабированием на сотни документов. Такой подход подтверждают практики из руководств по настройке RAG-агентов в n8n за 2026 год.

Шаг 1. Подключаем Google Drive и скачиваем файлы
Создайте отдельный воркфлоу препроцессинга, не смешивайте его с воркфлоу самого чат-агента. Триггер - либо ручной запуск, либо File Created в конкретной папке Google Drive, чтобы новые файлы подхватывались автоматически. Дальше нода Google Drive скачивает файл, а следующая нода извлекает из него текст.
Шаг 2. Режем текст на чанки
Recursive Character Text Splitter делит документ на куски примерно по 1000 символов с overlap около 250 символов. Без нахлеста модель теряет связь между соседними кусками текста. Для CSV и Excel лучше сначала объединить данные строки в один текстовый блок кодом, иначе вектора получаются рваными и агент не находит ответ.
Шаг 3. Заливаем данные в векторную базу
Embeddings Model, например text-embedding-3-small от OpenAI, превращает каждый чанк в вектор, а нода Vector Store в режиме Insert Documents записывает его в выбранную базу. Запомните модель эмбеддингов: если поменяете ее позже, старые и новые вектора окажутся несовместимы, и поиск сломается.
Как подключить память диалога отдельно от RAG?
У n8n четыре хорошо документированных типа памяти: Simple, Redis, Postgres и MongoDB. Каждый подходит под свой сценарий, и путать их с векторной базой RAG не стоит.
Simple Memory сбрасывается при перезапуске сессии и годится только для тестов. Redis Memory дает мгновенный отклик и подходит голосовым агентам, Postgres Memory стабильнее для продакшена, а MongoDB Memory держит большие объемы истории без просадки скорости поиска.
RAG отвечает за знания, memory - за контекст беседы. Их легко перепутать, потому что обе ноды цепляются к AI Agent, но задачи у них разные: RAG ищет факты, memory помнит, что вы уже спросили пять минут назад.

Ключевой момент для памяти - session ID. Если сделать его статичным на пользователя, например chat ID из Telegram, агент будет помнить конкретного человека между сессиями, а не только в рамках одного разговора.

| Тип памяти | Скорость | Стабильность | Когда использовать |
|---|---|---|---|
| Simple Memory | Высокая | Сбрасывается при рестарте | Тесты и MVP |
| Redis Memory | Максимальная | Нужен отдельный сервер | Голосовые и мгновенные агенты |
| Postgres Memory | Средняя | Высокая, готова для продакшена | Стабильные боты в проде |
| MongoDB Memory | Ниже, чем у Redis | Высокая, большие объемы | Сложные агенты с долгой историей |
Какой system prompt заставит агента реально пользоваться базой знаний?
Без прямого указания в system prompt агент часто отвечает по памяти обучения, игнорируя подключенную базу знаний. Нужно явно прописать обязательство свериться с vector store tool перед каждым ответом.
Агент использует свои внутренние знания по умолчанию, потому что это быстрее для модели, чем вызвать инструмент. System message должен прямо требовать: сначала проверь базу знаний, отвечай только на основе найденного, если данных нет - так и скажи. Без этой строчки агент может галлюцинировать, даже имея доступ к правильной базе.
Рабочий шаблон system prompt для RAG-агента в n8n выглядит примерно так, копируйте и адаптируйте под свою нишу:

«Ты ассистент компании [название]. Перед каждым ответом обязательно обращайся к инструменту [название vector store tool] и ищи релевантную информацию. Отвечай только на основе найденных данных. Если информации нет в базе, честно скажи об этом, не придумывай факты. Формулируй ответы кратко, 2-4 предложения, разговорным языком.»
Для сложных агентов с несколькими источниками добавьте Structured Output Parser: сгенерируйте JSON-схему через любую модель заранее, и агент начнет отдавать данные в предсказуемом формате. Это критично, если результат идет дальше по воркфлоу, а не просто в чат.
Сколько стоит собрать RAG-агента в n8n и сколько это займет времени?
Минимальная сборка укладывается в 2-4 часа и ноль рублей на инфраструктуру, если использовать self-host n8n и бесплатные тарифы Supabase. Основные расходы - токены модели и эмбеддинги, они считаются по факту использования.

n8n можно развернуть бесплатно на своем сервере через self-host, либо взять облако от 24 евро в месяц с лимитом 5000 выполнений воркфлоу. Векторная база и эмбеддинги OpenAI на старте обходятся в единицы долларов при небольшом объеме документов и растут пропорционально числу запросов, а не разово.
Реальная стоимость складывается из трех частей: сам n8n, векторная база и токены модели. Self-host версия n8n бесплатна, платите только за сервер, обычно от 5 долларов в месяц на базовом VPS.
| Компонент | Бесплатный вариант | Платный вариант |
|---|---|---|
| n8n | Self-host на своем сервере | Облако от €24/мес |
| Векторная база | Supabase pgvector до 500 МБ | От $25-70/мес |
| Embeddings + Chat Model | Оплата по факту токенов | От нескольких $ в месяц |
На практике сборка первого рабочего RAG-агента занимает вечер, если данных немного, 3-4 файла для теста. Масштабирование на сотни документов добавляет еще пару часов на автоматизацию препроцессинга.
Сильные и слабые стороны RAG-агента в n8n
Главный плюс RAG-агента в n8n - полный контроль над источником данных без обращения к закрытым сторонним чат-ботам. Главный минус - агент настолько хорош, насколько хорошо нарезаны чанки и прописан system prompt. Отладка "почему агент не нашел ответ" часто отнимает больше времени, чем сама сборка.

Сильные стороны:
- Данные остаются под вашим контролем: PDF, транскрипты и таблицы хранятся в вашей базе, а не в закрытом сервисе третьей стороны.
- Гибкость по моделям: под задачу можно подставить Claude, GPT или Gemini, не переписывая весь воркфлоу заново.
- Обновление знаний без переобучения: заменили файл в базе, и агент отвечает по-новому уже через минуту.
Слабые стороны:
- Настройка chunk size и overlap требует пары итераций проб и ошибок, идеального значения из коробки нет.
- Для баз меньше 20 PDF векторное хранилище часто избыточно, проще загрузить файлы напрямую в ассистента с функцией поиска по файлам.
- Без Structured Output Parser и явного system prompt агент периодически отвечает по памяти обучения вместо базы, и заметить это можно не сразу.
Лиза: «Раньше я вручную разбирала по 15-20 видео для одной единицы контента, часа четыре уходило. Написала скрипт, который сам вставляет ссылки, транскрибирует и раскладывает по 15 критериям. Стало 5,5 минуты вместо четырех часов. Тот же принцип работает и с загрузкой знаний в RAG: один раз настроил препроцессинг, дальше файлы просто скидываешь в папку.»

Если вы маркетолог и хотите готового агента под задачи без сборки с нуля, в каталоге есть отдельная подборка под нишу: агенты для маркетологов.
Частые вопросы про RAG и память в n8n
Чем RAG отличается от обычной памяти агента? Память хранит историю текущего диалога и обычно ограничена окном сообщений. RAG - это доступ к внешней базе знаний: документам, таблицам, транскриптам, которые агент ищет заново при каждом вопросе, независимо от истории чата.
Нужен ли код, чтобы собрать RAG-агента в n8n? Нет, весь пайплайн от загрузки документов до ответа агента собирается нодами через интерфейс n8n. Код может понадобиться только для нестандартной обработки данных, например объединения строк CSV перед загрузкой в базу.
Какую векторную базу выбрать новичку? Supabase pgvector, если хотите бесплатно и просто, или Qdrant Cloud, если важна скорость поиска и в планах self-host в будущем. Pinecone имеет смысл, когда данных уже сотни тысяч записей и бюджет на инфраструктуру заложен заранее.
Почему агент не находит ответ в базе, хотя данные загружены? Чаще всего проблема в system prompt: агент не обязан использовать инструмент, если это не прописано явно. Вторая частая причина - слишком маленький limit в настройке retrieve document, попробуйте диапазон от 2 до 4.
Сколько документов можно загрузить в RAG-агента? Технических ограничений почти нет, векторные базы масштабируются до миллионов записей. Практический совет: для 10-20 файлов векторная база иногда избыточна, а для сотен и тысяч документов это уже необходимость.
Можно ли использовать бесплатные модели вместо OpenAI и Claude? Да, n8n поддерживает DeepSeek, локальные модели через Ollama и другие варианты. С эмбеддингами сложнее: бесплатные модели работают хуже, точность поиска в базе заметно проседает по сравнению с text-embedding-3-small.
Глоссарий
- RAG (Retrieval Augmented Generation) - подход, при котором модель сначала ищет информацию в базе данных, а потом формирует ответ на ее основе.
- Векторная база данных - хранилище, где текст представлен в виде числовых векторов для поиска по смыслу, а не по ключевым словам.
- Embeddings (эмбеддинги) - числовое представление текста, отражающее его смысл и позволяющее находить похожие фрагменты.
- Chunk - кусок текста, на который документ разбивается перед превращением в вектор, обычно 500-1500 символов.
- Session ID - индивидуальный идентификатор диалога, по которому memory-нода понимает, чью историю сообщений подгружать.
- Text Splitter - нода в n8n, которая режет документ на чанки перед загрузкой в векторную базу.
- System Message (system prompt) - системная инструкция, задающая агенту роль, правила поведения и обязательные действия.
Собрать первого RAG-агента в n8n реально за один вечер, если начать с 3-4 файлов и не пытаться сразу построить систему на тысячу документов. Сравнение всех AI-инструментов для вайбкодинга смотрите в каталоге vibecoderz.ru/ide, а если нужна помощь с архитектурой конкретно под вашу задачу, пишите Максиму на консультацию: t.me/maxnagovitsyn.
Обновлено: август 2026.