Как научить ИИ-агентов помнить всё и при этом не разориться на токенах

16 июн 2026
26,760
2,518
92
1 день

Знакомая ситуация: вы долго объясняете агенту контекст проекта, специфику кода и правила именования, а через десять сообщений он всё «забывает» или начинает путаться. Агенты на базе LLM страдают от двух бед: либо они быстро теряют нить разговора из-за ограничений контекстного окна, либо пожирают бюджет на токены, если вы пытаетесь запихнуть в них всю историю переписки. Команда из TencentCloud выложила в опенсорс решение, которое выглядит как глоток свежего воздуха для тех, кто строит сложные системы на базе ИИ.

Проект называется TencentDB Agent Memory. Его основная идея проста: хватит скармливать модели «плоские» логи и тонны сырого текста. Вместо этого они предлагают многоуровневую систему памяти, которая имитирует человеческий подход — мы помним общие концепции (кто мы, что делаем) и умеем быстро находить детали только тогда, когда они действительно нужны.

В чем главная проблема текущих решений

Обычно разработчики решают вопрос памяти через RAG (Retrieval-Augmented Generation). Мы берем куски текста, превращаем их в векторы и складываем в базу. Но когда агент сталкивается с длинным процессом — например, написанием кода для целого модуля — этот подход начинает сбоить. В контекст прилетает куча разрозненных фрагментов, теряется структура задачи, а модель начинает галлюцинировать.

Разработчики из Tencent решили отойти от «свалки векторов» и внедрили иерархию. Они разделяют кратковременную память (то, что происходит прямо сейчас) и долговременную (кто такой пользователь и какие у него предпочтения). И делают это чертовски эффективно: тесты на SWE-bench показывают снижение расхода токенов на 33%, а успех выполнения задач при этом растет.

Как устроена магия слоев

Архитектура проекта опирается на две концепции: символическую кратковременную память и многослойную долговременную.

Реклама

Символическая память и диаграммы Mermaid

Это, пожалуй, самая интересная фишка. Вместо того чтобы хранить в контексте тяжелые логи работы инструментов (выводы терминала, результаты поиска), система сжимает их в компактные символы Mermaid. В контексте остается легковесная карта задач в виде графа. Если модели нужно уточнить деталь, она обращается к конкретному node_id и вытягивает сырые данные из внешнего хранилища.

Mermaid Canvas

Семантическая пирамида памяти

Для долгосрочного хранения используется четырехслойная структура:

  1. L0 Conversation: Сырые диалоги (базис).
  2. L1 Atom: Атомарные факты, извлеченные из разговора.
  3. L2 Scenario: Блоки сцен — группировка фактов по темам или ситуациям.
  4. L3 Persona: Итоговый профиль пользователя с его привычками и долгосрочными целями.

Memory Pyramid

Такая матрешка позволяет агенту не перечитывать всю историю ваших отношений, а сразу понимать: «Так, этот разработчик предпочитает TypeScript, не любит комментарии в коде и сейчас работает над микросервисом авторизации».

Практическая польза и цифры

Для нас как для разработчиков здесь важны не только теоретические слои, но и реальный профит. Ребята из Tencent приводят замеры при интеграции с OpenClaw. На длинных сессиях (около 50 последовательных задач) использование их плагина дает:

  • Снижение затрат на токены до 61%.
  • Рост точности определения «персоны» пользователя с 48% до 76%.
  • Увеличение шанса на успешное закрытие тикета в SWE-bench.

Это превращает агента из игрушки в рабочего помощника, который с каждым часом работы становится умнее, а не дороже.

Как пощупать проект самому

Проект написан на TypeScript и легко заводится локально. По умолчанию используется связка SQLite + sqlite-vec, так что вам не нужно разворачивать тяжелые векторные базы данных на старте.

Если вы используете OpenClaw, установка сводится к паре команд:

openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
openclaw gateway restart

В конфиге достаточно просто включить плагин:

{
  "memory-tencentdb": {
    "enabled": true
  }
}

Для тех, кто предпочитает Docker, есть готовый образ с интеграцией Hermes Agent. Это удобно, если хочется быстро поднять сервис и проверить, как агент реагирует на ваши старые запросы через неделю «разлуки».

Прозрачность и отладка

Многие системы памяти — это «черные ящики». Если агент выдал странный результат, вы не поймете, какой именно кусок старой памяти его на это натолкнул. В TencentDB Agent Memory всё сделано для людей:

  • Профили (Persona) хранятся в обычном Markdown.
  • Сценарии тоже можно прочитать глазами в виде текстовых файлов.
  • Все промежуточные артефакты лежат в папке ~/.openclaw/memory-tdai/.

Вы всегда можете зайти в директорию, открыть файл и увидеть, что именно агент запомнил о вас. Это сильно упрощает отладку сложных пайплайнов.

Кому это пригодится

Я вижу этот проект в руках тех, кто строит автономных агентов для кодинга или поддержки. Если ваш бот должен сопровождать клиента на протяжении недель или помогать в разработке крупного проекта, стандартный RAG быстро захлебнется в шуме.

TencentCloud сделали качественный инструмент, который решает конкретную боль — информационный перегруз LLM. Проект активно развивается, у него живой Discord и понятный Roadmap, где маячит автоматическая генерация навыков (Skills) на основе накопленного опыта. Определенно стоит добавить в закладки и попробовать в следующем пет-проекте.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.