Как перестать кормить контекстное окно и начать строить память для агентов
Представьте, что вы пишете код, но каждые 15 минут у вас стирается память о последних двух часах работы. Чтобы продолжить, вам нужно перечитать все свои заметки и куски кода заново. Примерно так сейчас чувствуют себя большинство AI-агентов. Мы заваливаем их огромными контекстными окнами, пытаемся «впихнуть невпихуемое» через RAG, но системного подхода к тому, как агент должен помнить, долгое время не было.
Недавно я наткнулся на репозиторий Agent-Memory-Paper-List, который пытается навести порядок в этом хаосе. Это не просто список ссылок, а полноценная попытка классифицировать всё, что человечество напридумывало про память ИИ за последние пару лет.
Почему это важнее очередного бенчмарка
Когда мы строим простого чат-бота, нам хватает истории сообщений. Но как только дело доходит до автономных агентов, которые должны выполнять задачи неделями (например, проводить глубокое исследование рынка или писать сложный софт), стандартный подход ломается.
Авторы проекта выделяют три фундаментальные проблемы текущих систем:
- Терминологическая путаница: разработчики часто путают память агента с RAG или просто грамотным промпт-инжинирингом.
- Фрагментарность: одни пилят векторные базы, другие — графы знаний, третьи — дообучение на лету, но общей картины нет.
- Сложность эволюции: как заставить агента забывать ненужное и закреплять полезный опыт?
В репозитории собрано более сотни значимых работ, структурированных по очень здравой логике. Если вы планируете внедрять агентов в продакшен, этот список может сэкономить недели на изобретение велосипедов.
Три измерения памяти
Самое ценное в этом проекте — классификация. Авторы предлагают смотреть на память через три призмы: формы, функции и динамику.
Формы: где лежат данные
Тут всё делится на три уровня:
- Token-level: это всё, что мы явно передаем в контекст. Сюда входят дискретные записи, логи и структурированные данные. Самый понятный и управляемый вид.
- Parametric: когда знания «зашиваются» в веса модели через LoRA или другие методы адаптации. Это модно, но дорого и трудно контролируемо.
- Latent: работа со скрытыми состояниями (hidden states). Это уровень «под капотом» трансформеров, где память живет в виде векторов активаций.
Функции: зачем это нужно
Это мой любимый раздел. Вместо того чтобы делить память просто на «краткосрочную» и «долгосрочную», авторы вводят функциональное деление:
- Factual (Фактическая): голые знания о мире или конкретной задаче.
- Experiential (Эмпирическая): инсайты и навыки, полученные в процессе работы. Агент сделал ошибку, отрефлексировал её и записал: «больше так не делай».
- Working Memory (Рабочая): управление текущим контекстом здесь и сейчас.
Динамика: жизненный цикл
Тут рассматриваются механизмы формирования памяти, её эволюции (включая очень важный момент — забывание) и стратегии извлечения.
Что внутри: от MemGPT до экзотики
В списке можно найти как попсу вроде MemGPT (который представил LLM как операционную систему с иерархией памяти), так и свежие работы начала 2026 года.
Например, в разделе Experiential Memory есть интересные статьи про «самоэволюционирующих» агентов. Идея в том, что агент хранит не просто логи чатов, а граф своих успешных и провальных траекторий. При следующей похожей задаче он делает поиск по этому графу и сразу понимает, какие инструменты сработали, а на каких он «споткнулся».
Кстати, авторы очень четко разграничивают Agent Memory и классический RAG. Если RAG — это внешняя библиотека, в которую мы подглядываем, то память агента — это активный процесс, который меняется в реальном времени под влиянием действий самого ИИ.
Практическая польза для разработчика
Если вы сейчас пишите своего агента на LangChain или CrewAI, не спешите просто подключать Pinecone и называть это памятью. Загляните в разделы:
- Working Memory: посмотрите статьи про сжатие контекста (Context Compression). Это поможет экономить токены без потери смысла.
- Factual Memory -> Token-level: обратите внимание на работы по Graph RAG. В 2024-2025 годах стало понятно, что обычного векторного поиска мало, нужны связи между сущностями.
- Experiential Memory: если ваш агент раз за разом совершает одни и те же ошибки, изучите концепцию Reflexion. Это когда агент ведет отдельный лог своих «выученных уроков».
Стоит ли следить за проектом
На мой взгляд — однозначно да. Репозиторий активно обновляется: за январь 2026 года добавлено уже несколько свежих пейперов. Проект набрал более 1400 звезд, что для узкоспециализированного списка литературы очень прилично.
Минус только один: README — это просто список ссылок. Вам всё равно придется открывать arXiv и читать оригиналы. Но как навигатор по туману современных нейросетевых исследований — это лучший инструмент на текущий момент.
Если вы чувствуете, что ваши агенты «тупят» из-за перегруженного контекста или неспособности учиться на своих косяках, начните изучать этот список. Возможно, решение вашей проблемы уже описано в статье, вышедшей пару недель назад.