Память AI-агента - это отдельный сервис за пределами разговора, который хранит факты о пользователе, о себе и о мире между сессиями. Контекстное окно решает только половину задачи: пока диалог помещается в лимит токенов, модель помнит все детали, а с…
400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
Память AI-агента - это отдельный сервис за пределами разговора, который хранит факты о пользователе, о себе и о мире между сессиями. Контекстное окно решает только половину задачи: пока диалог помещается в лимит токенов, модель помнит все детали, а стоит открыть новый чат, агент стартует с нуля. В статье разбираем три уровня решения проблемы: сжатие контекста внутри сессии, векторный retrieval из внешнего хранилища и графы знаний с временными связями между фактами. Обновлено: сентябрь 2026.
Агент забывает диалог, потому что LLM - stateless машина, а контекстное окно ограничено по размеру. Долгосрочная память живет отдельно от сессии: Mem0, Zep и Letta хранят факты в векторных базах и графах знаний. Ниже три уровня решения: сжатие, retrieval и temporal graph, плюс таблица цен и честный разбор бенчмарков 2026 года.
LLM обрабатывает каждый запрос заново и не хранит состояние между вызовами. Все, что агент "помнит" в моменте, это история сообщений, которую вы же и отправляете заново при каждом обращении.

Claude Sonnet 4.6, GPT-5.4 и любая другая модель технически stateless. Без истории переписки в промпте она не знает, что обсуждалось секунду назад: отправили новый вопрос без контекста, получили ответ так, будто разговора вообще не было. Агентный harness просто дописывает новую реплику в конец истории и заново отправляет весь блок целиком.
Проблема в объеме. У Sonnet 4.6 контекст 1 млн токенов на вход, но диалог, растянутый на часы работы с файлами и инструментами, забивает окно быстро. Тогда включается сжатие: система вроде Hermes ужимает историю, когда она достигает половины лимита. Лайфхак для прикидки размера без токенайзера: делите количество символов на 4, получите примерную оценку токенов.
Контекстное окно живет одну сессию и обнуляется при новом чате. Долгосрочная память - отдельный сервис, к которому агент обращается заново в каждом разговоре, поэтому она переживает перезапуски.
Разница принципиальная. Разработчики Mem0 прямо описывают долгосрочную память как сервис, вынесенный за пределы текущей сессии в отдельное хранилище: такой сервис способен обслуживать сразу нескольких агентов одного пользователя, и тогда ChatGPT, Claude и сторонний бот подтягивают один и тот же профиль фактов вместо трех разных.
В архитектуре вроде Hermes это разделение видно буквально по файлам. Файл soul.md задает личность самого агента, user.md копит факты о собеседнике и обновляется автоматически из разговоров, а memory.md хранит произвольные заметки и рабочие процессы. Три файла, три роли, и ни один не пересекается с содержимым текущего диалога напрямую.

Сжатие переписывает старую историю коротким пересказом, освобождая место под лимитом. Это не память в полном смысле, а способ дотянуть текущую сессию подольше без сбоя.
Сжатие срабатывает превентивно, при достижении настраиваемого порога вроде 50% от лимита, или реактивно, когда LLM возвращает ошибку переполнения контекста. Оно закрывает узкую задачу: не дать сессии упасть посреди работы над проектом. Проблема ровно та, что была заявлена в начале статьи: сжатие теряет детали. Точные цифры, редкие имена и мелкие договоренности из середины разговора часто пропадают при пересказе через саммари.
Поэтому сжатие контекста, по сути, заплатка на одну сессию, а не решение для памяти между визитами через недели. Для этого нужен отдельный уровень, который живет вне лимита токенов вообще.

Векторная память хранит факты в отдельной базе и достает их по смысловому сходству запроса, а не по точному совпадению слов. Агент получает только релевантный кусок вместо всей истории разговоров.
Mem0, один из самых распространенных провайдеров такой памяти, держит три хранилища: векторную базу для основных фактов, отдельное хранилище сущностей и SQLite для лога изменений и последних сообщений. Сохранение новых воспоминаний идет тремя путями: процедурно, когда агент сам фиксирует шаги действия, напрямую, простым сохранением без обработки, или через извлечение с помощью LLM. В последнем случае модель читает сводку о пользователе, свежие сообщения и уже найденные похожие воспоминания, а затем решает, что стоит добавить в базу.

Retrieval случается двумя способами: агент явно ищет через инструмент, или система сама подмешивает релевантные факты на каждом шаге без запроса от модели. Внутри пайплайна происходит ре-ранжирование: сначала берут пул в 4 раза больше нужного количества, или минимум 60 записей, затем считают совпадение по ключевым словам через BM25 и добавляют вес воспоминаниям, связанным с сущностями из запроса. Последние 10 сообщений из SQLite особенно важны, иначе агент теряет, к чему относится "он" или "она" в текущей фразе.

Для самого поиска нужны эмбеддинги. Bi-encoders кодируют каждое предложение независимо и подходят для быстрого поиска по большим базам. Cross-encoders точнее сравнивают пары текстов напрямую, но дороже квадратично с ростом коллекции. Для этапа извлечения фактов из диалога подойдут небольшие open-source модели на 1-12 млрд параметров, их можно гонять локально без API-счетов.

| Модель | Цена вход/выход за 1M токенов | Контекст | Подходит для |
|---|---|---|---|
| Nemotron 3 Super | $0.09 / $0.45, есть free-тир | 1M | Бюджетное извлечение фактов |
| DeepSeek V4 Flash | $0.14 / $0.28 | 1M / 384K вывод | Массовая обработка диалогов |
| Qwen3.7 Plus | $0.40 / $1.60 | 1M | Средний баланс цена и качество |
| Claude Haiku 4.5 | $1 / $5 | 200K / 64K | Точное извлечение сущностей |
Граф связывает факты между собой и отслеживает, какой из них актуален сейчас. Векторная база просто находит похожий текст, граф понимает, что новый факт заменяет старый.
Zep строит temporal knowledge graph: у каждого факта есть метка времени, а система отслеживает связи между записями. Если в январе пользователь написал "переехал в Берлин", а в июне "переехал в Мюнхен", Zep понимает, что второй факт отменяет первый, а не просто добавляет еще одну похожую запись рядом с прежней.

Похожий подход у открытого пакета Neo4j Agent Memory: он хранит и цепочку сообщений как короткую память, и граф сущностей со связями как долгую. Третий, менее очевидный слой в такой архитектуре - следы рассуждений, reasoning traces. Это записи о том, как агент пришел к выводу, а не только что он узнал в итоге. Такой слой позволяет агенту учиться на собственных прошлых решениях и делиться этим опытом с другими агентами того же пользователя.
Mem0 быстрее всего внедрить как готовый API. Zep выигрывает там, где факты меняются со временем. Letta дает полный stateful runtime агента, а не только слой памяти сверху.
Все три решают задачу по-разному, поэтому сравнение по фичам полезнее спора "что лучше" в вакууме.

| Провайдер | Архитектура | Цена (2026) | Кому подходит |
|---|---|---|---|
| Mem0 | Extract-and-retrieve, векторное хранилище плюс сущности | Free-тир 10К записей, платно от $19/мес | Быстрый старт, стандартный агент-ассистент |
| Zep | Temporal knowledge graph | От $25/мес, кредитная модель | Факты, которые меняются со временем: адреса, статусы, предпочтения |
| Letta (бывший MemGPT) | Полный agent runtime, память из трех уровней: core, recall, archival | Есть free-тир | Когда нужна не память сверху, а вся архитектура агента целиком |
| Cognee | Граф плюс документы | Free, платно до $200/мес | Большие корпусы неструктурированных документов |
Cursor и Claude Code часто подключают именно такие внешние сервисы через MCP, когда собирают агента с памятью между сессиями, вместо того чтобы писать retrieval с нуля.
LongMemEval и LoCoMo стали негласным стандартом оценки памяти агентов. Но цифры, которые публикует сам вендор, и результаты независимых прогонов того же теста часто расходятся в разы.
Mem0 указывает в собственном research-отчете 92.5 балла на LoCoMo и 94.4 на LongMemEval при среднем расходе около 6.7-7 тысяч токенов на запрос. Это сильные цифры, но они получены на харнессе самого вендора. По факту рынок памяти агентов в 2026 году, вероятно, самая бенчмаркаемая и наименее воспроизводимая категория AI-инструментов: независимые прогоны того же продукта нередко показывают заметно другой результат.
Практический вывод простой: не бери показатели с лендинга за чистую монету. Перед выбором стоит прогнать собственный реальный сценарий на паре кандидатов, а не полагаться только на маркетинговый график с сайта провайдера.

Для извлечения фактов из диалога хватает небольшой модели на 1-12 млрд параметров. Для самого поиска важнее качество специализированной embedding-модели, а не размер основной LLM агента.
Разделение задач экономит деньги напрямую. Экстракция, то есть выделение фактов из свежей реплики, не требует топового reasoning: достаточно бюджетной модели вроде Nemotron 3 Super с free-тиром или DeepSeek V4 Flash по $0.14 за миллион входных токенов. Основной агент при этом продолжает работать на Sonnet 4.6 или Opus 4.8, это отдельный контур расходов.
Для эмбеддингов важнее не бренд модели, а насколько она дообучена под конкретный домен. Специализированные модели, обученные методом контрастивного обучения на данных вашей ниши, показывают лучший semantic similarity, чем универсальная модель общего назначения. Если размеченных пар для дообучения нет, помогает TSDAE, метод адаптации модели к языку домена на сыром неразмеченном тексте.
Три уровня закрывают три разных сценария. Сжатие контекста продлевает одну сессию, retrieval из векторной базы дает агенту память между визитами, а граф знаний нужен там, где факты о пользователе меняются со временем и это важно учитывать при ответе.
Лиза: «Для одной ниши в Текст Заводе собрала 90 листов Excel и полтора миллиона ключей вместе с Codex. Он реально собирает частотность и находит запросы, до которых я бы вручную никогда не додумалась. Можно на 30 минут отойти, он продолжает сам».
Для вайбкодеров, которые собирают агента с нуля в Claude Code или Cursor, разумный путь такой: начать с Mem0 как самого быстрого API, добавить временные метки через Zep, если продукт работает с меняющимися фактами, и переходить на полный runtime Letta только когда памяти как отдельного слоя уже недостаточно. Каталог AI-инструментов на VibeCoderz поможет сравнить IDE под такую задачу, а если нужен разбор архитектуры под конкретный продукт, записаться на консультацию к Максиму можно в Telegram.
Чем долгосрочная память отличается от контекстного окна? Контекстное окно живет одну сессию и обнуляется при новом чате. Долгосрочная память вынесена в отдельный сервис и переживает перезапуски, потому что агент каждый раз подтягивает ее заново, а не хранит внутри одного диалога.
Можно ли обойтись без внешнего сервиса памяти и просто увеличить контекст? Технически да, но дорого и ненадежно. Даже 1М токенов контекста у Sonnet 4.6 или Gemini 3.1 Pro забивается за пару часов активной работы агента с файлами, а длинный контекст сам по себе не решает задачу приоритизации фактов.
Что произойдет, если два факта о пользователе противоречат друг другу? В простой векторной памяти оба факта останутся рядом, и агент может выбрать устаревший. В temporal graph вроде Zep у каждого факта есть метка времени, и система понимает, что новый факт отменяет старый.
Нужен ли граф знаний маленькому Telegram-боту с парой сотен пользователей? Чаще всего нет. Для персонального ассистента с простыми предпочтениями хватает векторной памяти уровня Mem0. Граф оправдан, когда факты о пользователе действительно меняются со временем и это критично для ответа.
Сколько стоит подключить долгосрочную память к своему агенту? От бесплатного free-тира Mem0 на 10 тысяч записей до $250/мес на growth-тарифах у крупных провайдеров. При self-host на open-source моделях расход сводится к цене токенов извлечения, которая при бюджетной модели вроде DeepSeek V4 Flash минимальна.
Как проверить, что память агента реально работает, а не просто выглядит красиво в демо? Прогони собственный сценарий с фактами, которые меняются во времени, и посмотри, подтянет ли агент актуальную версию через несколько сессий подряд. Цифры вендора на LongMemEval и LoCoMo не всегда воспроизводятся независимо, свой тест надежнее чужого бенчмарка.
LLM - большая языковая модель, которая генерирует текст на основе промпта и по своей природе stateless, то есть не хранит состояние между отдельными запросами.
Контекстное окно - лимит токенов, которые модель обрабатывает за один вызов, включая и промпт, и ответ.
Retrieval - процесс поиска и извлечения релевантных данных из внешнего хранилища по запросу.
Ingestion - процесс сохранения новой информации в память, обычно с предварительной обработкой через LLM.
Векторное хранилище - база данных, которая хранит текст в виде числовых векторов и ищет по смысловому сходству, а не по точному совпадению слов.
Эмбеддинг - числовое представление текста, где семантически близкие фразы оказываются рядом друг с другом в векторном пространстве.
Граф знаний - структура данных, где факты представлены как узлы, а связи между ними как ребра, что позволяет отслеживать отношения и изменения во времени.
Reasoning traces - записи о ходе размышлений агента, а не только об итоговом факте, полезны для самообучения между сессиями.
Больше про инструменты для сборки агентов, включая Claude Code и Cursor, в каталоге VibeCoderz. По вопросам внедрения памяти в собственного агента пишите Максиму в Telegram.
Обновлено: сентябрь 2026.