Как научить ИИ-агентов помнить всё и при этом не разориться на токенах
Знакомая ситуация: вы долго объясняете агенту контекст проекта, специфику кода и правила именования, а через десять сообщений он всё «забывает» или начинает путаться. Агенты на базе LLM страдают от двух бед: либо они быстро теряют нить разговора из-за ограничений контекстного окна, либо пожирают бюджет на токены, если вы пытаетесь запихнуть в них всю историю переписки. Команда из TencentCloud выложила в опенсорс решение, которое выглядит как глоток свежего воздуха для тех, кто строит сложные системы на базе ИИ.
Проект называется TencentDB Agent Memory. Его основная идея проста: хватит скармливать модели «плоские» логи и тонны сырого текста. Вместо этого они предлагают многоуровневую систему памяти, которая имитирует человеческий подход — мы помним общие концепции (кто мы, что делаем) и умеем быстро находить детали только тогда, когда они действительно нужны.
В чем главная проблема текущих решений
Обычно разработчики решают вопрос памяти через RAG (Retrieval-Augmented Generation). Мы берем куски текста, превращаем их в векторы и складываем в базу. Но когда агент сталкивается с длинным процессом — например, написанием кода для целого модуля — этот подход начинает сбоить. В контекст прилетает куча разрозненных фрагментов, теряется структура задачи, а модель начинает галлюцинировать.
Разработчики из Tencent решили отойти от «свалки векторов» и внедрили иерархию. Они разделяют кратковременную память (то, что происходит прямо сейчас) и долговременную (кто такой пользователь и какие у него предпочтения). И делают это чертовски эффективно: тесты на SWE-bench показывают снижение расхода токенов на 33%, а успех выполнения задач при этом растет.
Как устроена магия слоев
Архитектура проекта опирается на две концепции: символическую кратковременную память и многослойную долговременную.
Символическая память и диаграммы Mermaid
Это, пожалуй, самая интересная фишка. Вместо того чтобы хранить в контексте тяжелые логи работы инструментов (выводы терминала, результаты поиска), система сжимает их в компактные символы Mermaid. В контексте остается легковесная карта задач в виде графа. Если модели нужно уточнить деталь, она обращается к конкретному node_id и вытягивает сырые данные из внешнего хранилища.

Семантическая пирамида памяти
Для долгосрочного хранения используется четырехслойная структура:
- L0 Conversation: Сырые диалоги (базис).
- L1 Atom: Атомарные факты, извлеченные из разговора.
- L2 Scenario: Блоки сцен — группировка фактов по темам или ситуациям.
- L3 Persona: Итоговый профиль пользователя с его привычками и долгосрочными целями.

Такая матрешка позволяет агенту не перечитывать всю историю ваших отношений, а сразу понимать: «Так, этот разработчик предпочитает TypeScript, не любит комментарии в коде и сейчас работает над микросервисом авторизации».
Практическая польза и цифры
Для нас как для разработчиков здесь важны не только теоретические слои, но и реальный профит. Ребята из Tencent приводят замеры при интеграции с OpenClaw. На длинных сессиях (около 50 последовательных задач) использование их плагина дает:
- Снижение затрат на токены до 61%.
- Рост точности определения «персоны» пользователя с 48% до 76%.
- Увеличение шанса на успешное закрытие тикета в SWE-bench.
Это превращает агента из игрушки в рабочего помощника, который с каждым часом работы становится умнее, а не дороже.
Как пощупать проект самому
Проект написан на TypeScript и легко заводится локально. По умолчанию используется связка SQLite + sqlite-vec, так что вам не нужно разворачивать тяжелые векторные базы данных на старте.
Если вы используете OpenClaw, установка сводится к паре команд:
openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
openclaw gateway restart
В конфиге достаточно просто включить плагин:
{
"memory-tencentdb": {
"enabled": true
}
}
Для тех, кто предпочитает Docker, есть готовый образ с интеграцией Hermes Agent. Это удобно, если хочется быстро поднять сервис и проверить, как агент реагирует на ваши старые запросы через неделю «разлуки».
Прозрачность и отладка
Многие системы памяти — это «черные ящики». Если агент выдал странный результат, вы не поймете, какой именно кусок старой памяти его на это натолкнул. В TencentDB Agent Memory всё сделано для людей:
- Профили (Persona) хранятся в обычном Markdown.
- Сценарии тоже можно прочитать глазами в виде текстовых файлов.
- Все промежуточные артефакты лежат в папке
~/.openclaw/memory-tdai/.
Вы всегда можете зайти в директорию, открыть файл и увидеть, что именно агент запомнил о вас. Это сильно упрощает отладку сложных пайплайнов.
Кому это пригодится
Я вижу этот проект в руках тех, кто строит автономных агентов для кодинга или поддержки. Если ваш бот должен сопровождать клиента на протяжении недель или помогать в разработке крупного проекта, стандартный RAG быстро захлебнется в шуме.
TencentCloud сделали качественный инструмент, который решает конкретную боль — информационный перегруз LLM. Проект активно развивается, у него живой Discord и понятный Roadmap, где маячит автоматическая генерация навыков (Skills) на основе накопленного опыта. Определенно стоит добавить в закладки и попробовать в следующем пет-проекте.
