Как научить нейросеть помнить всё и не разориться на токенах

23 Jul, 2026
10,342
🔱 944
👥 44

Знакомая ситуация: вы долго объясняете LLM контекст своего проекта, настраиваете её «под себя», а через пару дней она всё забывает. Или, что ещё хуже, вы пытаетесь впихнуть в контекстное окно гигантскую базу знаний, и счёт за токены начинает напоминать номер телефона. Разработчики из MemTensor решили подойти к этой проблеме системно и выкатили MemOS — проект, который они называют «операционной системой памяти» для ИИ-агентов.

Что это вообще такое

Если упростить, MemOS — это промежуточный слой между вашим приложением и языковой моделью. Вместо того чтобы каждый раз скармливать нейронке всю историю переписки или огромные куски RAG-контекста, вы используете внешнюю управляемую память.

Проект интересен тем, что это не просто векторная база данных. Это именно система управления, которая умеет структурировать информацию, обновлять её на основе фидбека и, самое приятное, экономить до 35% токенов за счёт умного кэширования и фильтрации контекста.

Чем MemOS отличается от обычного RAG

Обычный RAG (Retrieval-Augmented Generation) работает прямолинейно: нашли похожие куски текста — засунули в промпт. MemOS работает тоньше.

Во-первых, здесь память представлена в виде графа. Это значит, что система понимает связи между сущностями, а не просто ищет совпадения по векторам. Вы можете редактировать или удалять конкретные воспоминания через API, как записи в обычной базе данных.

Во-вторых, ребята реализовали многоуровневую структуру. В версии 2.0 (Stardust) они выделили три уровня:

  1. L1 Trace — сырые следы взаимодействий.
  2. L2 Policy — правила и предпочтения, которые формируются на основе опыта.
  3. L3 World Model — глобальное понимание контекста и навыков.

Интересная деталь: система поддерживает мультимодальность. В память можно сохранять не только текст, но и изображения, графики или трейсы вызовов инструментов (tool traces). Если ваш агент вчера анализировал скриншот ошибки, сегодня он сможет «вспомнить» детали этого анализа.

Как это работает на практике

Для тех, кто предпочитает self-hosted решения, MemOS разворачивается через Docker. Внутри связка из Python, Neo4j для графов и Qdrant для векторного поиска.

Пример того, как выглядит добавление информации в память через Python:

import requests
import json

data = {
    "user_id": "my-dev-id",
    "mem_cube_id": "project-alpha",
    "messages": [
        {
            "role": "user",
            "content": "Я предпочитаю писать код на Go, но для скриптов использую Python"
        }
    ],
    "async_mode": "sync"
}
url = "http://localhost:8000/product/add"
res = requests.post(url=url, json=data)
print(res.json())

А когда вам нужно что-то уточнить, вы просто делаете поиск по user_id. Система сама вытащит нужные факты и подмешает их в контекст.

Кстати, в проекте есть классная фишка — MemScheduler. Это планировщик на базе Redis Streams, который обрабатывает операции с памятью асинхронно. Это критично для продакшена: пользователь не должен ждать лишнюю секунду, пока система «переваривает» и индексирует его последнее сообщение.

Экономия токенов и точность

Разработчики заявляют о росте точности на 43% по сравнению со стандартной памятью OpenAI. Цифра звучит громко, но она подкреплена статьями на arXiv и тестами вроде LongMemEval.

Что касается денег: за счёт того, что MemOS умеет отсекать лишнее и не гонять одни и те же данные в каждом запросе, потребление токенов снижается примерно на треть. В масштабах нагруженного сервиса это может сэкономить приличную сумму.

Кому стоит попробовать

Проект выглядит избыточным для простого чат-бота «вопрос-ответ». Но он станет спасением, если вы строите:

  • Персонализированных ассистентов, которые должны помнить предпочтения пользователя месяцами.
  • Сложных агентов, работающих с инструментами (tool use), где нужно хранить историю вызовов и их результаты.
  • Корпоративные базы знаний, где информация постоянно обновляется и требует ручной корректировки.

Из минусов: документация местами кажется перегруженной, а настройка всех компонентов (Neo4j, Qdrant, Redis) потребует времени. Но возможность запустить всё это локально без привязки к облакам — жирный плюс для тех, кто печётся о приватности данных.

Если хотите потыкать проект без развёртывания своей инфраструктуры, у них есть Cloud API и дашборд для визуализации того, что именно «помнит» ваш агент.

MemOS Plugin

MemOS — это попытка превратить хаотичный контекст LLM в структурированную и управляемую базу данных. Это шаг от «умного чата» к полноценным автономным системам, которые не просто генерируют текст, а накапливают опыт.

Посмотреть исходники и документацию можно в репозитории на GitHub. Там же лежат ссылки на научные статьи, если хочется закопаться в математику и архитектуру системы.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.