MemGPT (проект переименован в Letta еще в сентябре 2024 года) — архитектура, где языковая модель сама решает, что держать в контекстном окне, а что вынести во внешнее хранилище. Иерархическая память LLM здесь работает почти как в обычном компьютере:…
400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
MemGPT (проект переименован в Letta еще в сентябре 2024 года) — архитектура, где языковая модель сама решает, что держать в контекстном окне, а что вынести во внешнее хранилище. Иерархическая память LLM здесь работает почти как в обычном компьютере: быстрый и тесный core memory плюс медленный, но почти безразмерный архив. Разберем три уровня памяти Letta, сравним подход с Mem0 и покажем, когда какую систему реально ставить в прод в 2026 году.
Letta — это MemGPT, выросший в отдельную компанию с 10 млн долларов посевных инвестиций и 23 354 звездами на GitHub. Память агента разбита на три уровня: core, recall и archival. Mem0 проще и дешевле для быстрого старта, Letta — для агентов, которые живут неделями без перезапуска. Ниже разбор архитектуры, бенчмарков и цен на сентябрь 2026.

MemGPT — исследовательская работа UC Berkeley 2023 года про виртуальное управление контекстом. Осенью 2024 команда развернула ее в открытый фреймворк и компанию под именем Letta.
Идея статьи «MemGPT: Towards LLMs as Operating Systems» простая: контекстное окно модели работает как оперативная память компьютера. Быстрое, но маленькое. Все остальное живет на "диске", во внешнем хранилище, откуда данные подгружаются по вызову функции. Такой вывод.
Авторы Packer, Wooders, Lin, Fang, Patil, Stoica и Gonzalez опубликовали препринт в октябре 2023 года, arXiv:2310.08560. Идея разлетелась по Hacker News за несколько часов и собрала десятки тысяч звезд еще до официального релиза. Через год исследовательский код превратился в производственный фреймворк с CLI, REST API и облаком. По данным GhTrends, к июню 2026 репозиторий letta-ai/letta набрал 23 354 звезды, больше 2 400 форков и свыше сотни контрибьюторов. Название сменили, MemGPT стал Letta, но ядро осталось прежним.
Агент делит память на то, что физически лежит в контекстном окне, и то, что лежит снаружи и подгружается через вызов функции. Letta сам решает, когда двигать данные между уровнями.
Система предупреждает о переполнении на 70% заполнения контекста и принудительно сбрасывает данные при 100%, сохраняя рекурсивную выжимку вытесненного. Так работал еще оригинальный MemGPT, и Letta унаследовала этот механизм почти без изменений. Именно это и называют паттерном виртуальной памяти LLM.

Core memory — это быстрый уровень, аналог оперативной памяти. Здесь живут системные инструкции (read-only) и рабочий блок, который агент правит сам через функции. Например: "имя пользователя — Настя, предпочитает короткие ответы без эмодзи". Модель переписывает этот блок при получении новых фактов, без участия человека и без дообучения.
Recall storage хранит полную историю сообщений, archival storage — произвольные тексты и документы. Оба уровня достаются через поиск: по времени, по тексту или по эмбеддингу. Для бота поддержки archival storage может держать переписку за год, а core memory — только пять фактов о клиенте, важных прямо сейчас.
Три уровня закрывают три разные задачи: что видно прямо сейчас, что было недавно и что нужно искать целенаправленно.

| Уровень | Аналог в ОС | Что хранит | Кто пишет |
|---|---|---|---|
| Core memory | RAM | Персона, факты о пользователе, текущая задача | Агент через функции |
| Recall memory | Кэш диска | Полная история диалога, доступна поиском | Система автоматически |
| Archival memory | Холодное хранилище | Документы, длинные тексты, база знаний | Агент по запросу |
Короче, чем дальше уровень от контекстного окна, тем он дешевле и вместительнее, но и медленнее в доступе. Ровно тот же компромисс, что между RAM и SSD на обычном сервере.
Mem0 — это слой памяти, который добавляют к существующему агенту. Letta — целая среда выполнения, агент запускается внутри нее. Разница в том, сколько инфраструктуры вы берете на себя.
По сравнению Vectorize, Mem0 оптимизирован под скорость подключения: SDK, API-ключ, вызов add() и search() — рабочая память за несколько минут. У Mem0 около 48 тысяч звезд на GitHub, это больше комьюнити, примеров и готовых интеграций. Letta требует принять всю платформу целиком: цикл агента, вызов инструментов, персистентность состояния.

Прямых опубликованных бенчмарков между двумя системами почти нет, результаты сильно зависят от модели и промптов. Зато A-MEM, более поздняя работа, заявляет вдвое лучшую точность на многошаговых задачах именно за счет отказа от жесткой иерархии MemGPT в пользу динамического управления памятью.
Оба сервиса дают бесплатный вход, но с разными лимитами. Letta считает агентов, Mem0 считает запросы к памяти.
Letta Pro стоит 20 долларов в месяц за 20 стейтфул-агентов плюс квоту на модель Letta Auto с оплатой за перерасход. У Mem0 нижний платный тариф Starter стоит 19 долларов при 50 тысячах add-запросов и 5 тысячах retrieval-запросов в месяц — и это без графовой памяти, ее открывают только на тарифе Pro за 249 долларов.

| Сервис | Бесплатный тариф | Первый платный тариф | Что дает |
|---|---|---|---|
| Letta | 3 управляемых агента, свой API-ключ | $20/мес, 20 агентов | Полная агентная среда, ADE-редактор памяти |
| Mem0 | 10 000 memories, 1 000 retrieval/мес | $19/мес, 50 000 add | Векторная память, быстрый SDK |
| Zep | 10 000 кредитов, 2 проекта | ~$104/мес (Flex) | Temporal knowledge graph, аудит и ретеншн |
Для соло-проекта бесплатных лимитов Letta и Mem0 обычно хватает на пилот. Zep дороже, но там платите за граф с датами валидности фактов, а не просто за хранилище.
На тесте Deep Memory Retrieval оригинальный MemGPT поднял точность модели с 32,1% до 92,5% против baseline с рекурсивной суммаризацией. Позже Zep заявил результат выше — 94,8% против 93,4% у MemGPT.
DMR проверяет способность агента ответить на вопрос, ссылающийся на разговор из прошлой сессии, с узким диапазоном правильных ответов. GPT-4 с рекурсивной суммаризацией истории теряет детали уже через несколько итераций сжатия, это ожидаемо: суммаризация по своей природе lossy-процесс.
На вложенном key-value retrieval (нужно сделать несколько последовательных подстановок, чтобы найти финальное значение) GPT-3.5 падал до 0% точности уже на первом уровне вложенности, GPT-4 держался чуть дольше и обнулялся на четвертом. MemGPT точность не терял вообще, потому что искал пары значений напрямую в archival memory, а не пытался удержать их все в контексте разом.

Простое правило: если мир агента почти статичен и задача — запоминание, хватит векторного слоя вроде Mem0. Если факты меняются во времени и важна история изменений, смотрите в сторону графовых систем или Letta.
Максим: «У меня в приложении для Роберта зашиты 25 принципов воспитания, которые я сформулировал сам. Это не продукт на продажу, чисто для себя. Но по сути это тот же archival storage, что в Letta: база фактов лежит отдельно от диалога, и агент подтягивает из нее только то, что нужно в моменте.»

Для чат-бота поддержки клиентов или личного ассистента Mem0 надежнее — простой чат, короткая память, минимум инфраструктуры. Для агента, который ведет проект неделями и должен помнить, что менялось и когда, лучше подходит Letta или Zep. Если вы собираете такого агента через Claude Code или другой инструмент с поддержкой MCP, слой памяти определяет, забудет ли ассистент контекст проекта после перезапуска сессии.
Иерархическая память решает проблему забывания, но не бесплатно: она требует моделей с надежным function calling и добавляет сложность в инфраструктуру.
Оригинальный MemGPT работал стабильно только на моделях OpenAI, специально дообученных под функции. GPT-3.5 и Llama 2 70B регулярно генерировали синтаксически неверные вызовы функций или изобретали несуществующие. Летом 2026 ситуация лучше — модель-агностичный дизайн Letta поддерживает Anthropic, Mistral и локальные модели, но требование к качеству tool calling никуда не делось.
Есть нюанс с self-hosting: сервер Letta хранит состояние агентов в PostgreSQL, и самостоятельно развернутый бэкенд иногда отстает по фичам от облака. Визуальный редактор памяти (ADE) тоже не всегда стабильно работает против self-hosted инстанса — это честно признают сами разработчики.

Контекстное окно — это лимит токенов, которые модель видит за один вызов. Память агента — более широкое понятие: она включает контекст плюс все, что хранится снаружи и может быть туда подгружено по запросу.
По сути да. Letta — прямое продолжение проекта MemGPT, тот же стек идей из UC Berkeley, но развернутый в производственную платформу с облаком, CLI и коммерческой поддержкой с сентября 2024 года.
Да, бесплатный тариф дает до трех управляемых агентов с собственным API-ключом, без обязательной регистрации для локального запуска.
Mem0. Установка SDK, вызов add() и search(), рабочая память за минуты. Letta требует понимания агентного цикла и серверной части.
Для archival storage да, обычно используется embedding-поиск поверх векторного хранилища. Core и recall memory можно держать в обычной базе вроде PostgreSQL.
Модель нестабильно генерирует корректные вызовы функций, а вся система построена на function calling. Без надежных вызовов агент не может двигать данные между уровнями памяти.
Система с temporal knowledge graph, например Zep: там факты хранятся с окном валидности, и агент видит, когда информация устарела, а не просто перезаписывает старое значение новым.
Иерархическая память — не единственный слой в стеке агента, но без нее любой длинный диалог рано или поздно упрется в лимит контекста. Обзоры инструментов для построения таких агентов смотрите в каталоге VibeCoderz, а если нужна помощь с архитектурой конкретного проекта — пишите на консультацию Максиму.
Обновлено: сентябрь 2026.