Tencent открыл память для агентов - минус 61% токенов
Tencent открыл память для агентов - минус 61% токенов
Tencent Cloud выложила в open source TencentDB Agent Memory - систему долгой памяти для ИИ-агентов, которая на бенчмарке WideSearch снижает расход токенов на 61,38% и одновременно поднимает успешность задач с 33% до 50%. Лицензия MIT, разворачивается локально, интегрируется с фреймворками OpenClaw и Hermes. Ниже - что это, как работает и что с этим делать, если у вас уже есть агенты на Claude или своя обвязка.
Что это такое одним абзацем
TencentDB Agent Memory - открытый "мозг" для агентов, который отделяет память от контекстного окна модели. Вместо того чтобы каждый раз пихать всю переписку в промпт, агент откладывает старое в четыре хранилища: Chat Memory (факты, решения, предпочтения), Skill Library (наработанные приёмы), Wiki (документы и спеки) и CodeGraph (код, символы, вызовы). При новом запросе система достаёт релевантный кусок и подкладывает в промпт. Всё локально, без внешних API. Ссылка: github.com/TencentCloud/TencentDB-Agent-Memory, ~14,5k звёзд, ~1,3k форков, MIT.
Как получается минус 61% токенов
Механика простая: старый контекст автоматически сжимается в компактную "карту задач". Tencent называет это Symbolic Short-Term Memory - логи инструментов и промежуточные шаги описываются через синтаксис Mermaid (то же самое, что диаграммы в GitHub). Это в разы короче исходного текста и всё ещё пригодно для модели: она видит структуру, а не портянку.
Цифры из README, WideSearch benchmark, 50 задач подряд в одной сессии:
- токены: 221,31M → 85,64M (сокращение 61,38%);
- SWE-bench: −33,09% токенов (3474,1M → 2375,4M);
- AA-LCR: −30,98% токенов (112,0M → 77,3M).
Если вы платите за API, это прямая экономия. Если крутите модель локально - это скорость и возможность выполнить длинную задачу до конца, а не упереться в контекстное окно на 30-м шаге.
Почему агент забывает "кем он был"
Отдельная проблема, которую Tencent замерила отдельно: удержание "личности" агента. Ставишь ему инструкцию "ты редактор", даёшь 50 задач подряд - и на 30-й он превращается обратно в дефолтную модель, забывает роль и инструкции. На бенчмарке PersonaMem базовая точность - 48%. С TencentDB Agent Memory - 76% (+59% относительно).
Работает это через Layered Long-Term Memory: раз в 50 новых записей система дистиллирует их в структурированные Personas и Scenes и хранит отдельно от текущего диалога. При каждом обращении Persona подкладывается обратно в контекст. Дефолт: L1-экстракция каждые 5 ходов, отдача recall - 5 элементов, таймаут 5 секунд.
Что внутри - четыре типа памяти
Память разделена на слои, чтобы разные типы знаний не мешали друг другу:
- Chat Memory - факты, решения, предпочтения пользователя. То, что обычно теряется между сессиями.
- Skill Library - приёмы, которые агент нашёл сам или получил. С версионированием и валидацией.
- Wiki - структурированные документы и спецификации с граф-связями.
- CodeGraph - индекс кода: символы, файлы, вызовы. Для инженерных агентов важен больше остального.
Отдельно есть Memory Hub Panel - панель управления и права доступа: private / team / ACL. То есть один и тот же набор знаний можно расшарить между несколькими агентами команды и не собирать эти знания заново под каждого.
Как поставить локально
Прямая инструкция из репозитория:
git clone https://github.com/Tencent/TencentDB-Agent-Memory.git
cd TencentDB-Agent-Memory/deploy/global-images
cp .env.example .env
./start-all.sh
Дальше два пути. Первый - интеграция с OpenClaw через плагин:
openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
openclaw gateway restart
Второй - Hermes Agent через Docker. Готовых интеграций с Claude Code, Cursor или LangChain в репозитории пока нет - Tencent сделала первую волну под свои же фреймворки.
Что делать, если у вас Claude Code, а не OpenClaw
Прямого плагина нет, но идея переносимая. Самый быстрый способ разобраться и адаптировать под себя - запустить Claude Code в папке склонированного репо и попросить его разобрать архитектуру:
Прочитай README и структуру этого репозитория. Объясни, как устроен Symbolic Short-Term Memory (сжатие в Mermaid) и Layered Long-Term Memory (Personas). Покажи, какие модули из /src отвечают за экстракцию памяти каждые 5 ходов. Составь список того, что нужно сделать, чтобы аналогичную систему подключить к моему агенту на TypeScript (агент общается с моделью через Anthropic SDK). Не пиши код - сначала план.
Дальше по шагам с ним же собираете свою обвязку под свой стек. Это дешевле и быстрее, чем ждать официальный коннектор.
Реальные цифры на бенчмарках
Свёл в одну таблицу, чтобы не искать по README:
| Бенчмарк | Успех до | Успех после | Токены |
|---|---|---|---|
| WideSearch | 33% | 50% | −61,38% |
| SWE-bench | 58,4% | 64,2% | −33,09% |
| AA-LCR | 44,0% | 47,5% | −30,98% |
| PersonaMem | 48% | 76% | - |
WideSearch - самый показательный случай: там задачи длинные, шагов много, обычный агент разваливается. Именно там прирост максимальный.
FAQ
Работает ли это с Claude или GPT? Система провайдер-нейтральная. Она сидит между агентом и моделью и подсовывает уплотнённый контекст. Модель может быть любая - Claude, GPT, локальная. Но готовых плагинов под Anthropic SDK и OpenAI SDK в репозитории пока нет, интеграция ручная.
Нужна ли векторная база? Нет. Явное отличие Tencent-подхода - без vector DB, только локальные слои. Это плюс в скорости и в приватности, минус - хуже семантический поиск на очень больших корпусах.
Насколько сырое решение? 14,5k звёзд за пару месяцев, MIT, есть примеры и docker-compose. При этом много открытых issues и активных PR - разработка идёт, вкорячивать в прод пока рано, тестовые агенты - можно.
Что с приватностью данных? Всё локально, внешних API вызовов нет. Хранение - на вашей машине или на вашем сервере. Это, собственно, главный аргумент против облачных memory-сервисов типа Zep или Mem0.
Можно ли использовать только один слой, например Chat Memory? Да, слои независимы. Можно поднять только Chat Memory для сохранения предпочтений пользователя между сессиями, без Skill Library и CodeGraph.
Вывод
TencentDB Agent Memory - редкий случай, когда крупная лаба выкатила рабочее решение под MIT-лицензией с реальными цифрами и без "нам заплатите за API". Если вы уже пилите агентов, тратите деньги на токены и упираетесь в контекстное окно на длинных задачах - разбирать репо однозначно стоит. Прямого плагина под Claude Code нет, но идея переносимая, и полдня работы через Claude Code хватит, чтобы понять, что из архитектуры можно утащить в свой стек.
Что дальше
Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.
Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.
Telegram @mike_cmo →