Как перестать скармливать агентам токены впустую и научить их писать рабочий код
Каждый, кто пробовал поручить Claude Code или Cursor задачу крупнее одного файла, знает это чувство. Первые пару минут всё выглядит отлично. Агент бодро создает интерфейсы, раскидывает типы, но к четвертому файлу контекст забивается мусором. Модель забывает первоначальные требования, ломает соседние модули и начинает ходить по кругу, генерируя галлюцинации вместо тестов.
По данным создателей проекта Context Engineering Kit, при обычном one-shot промпте вероятность получить полностью рабочий результат без ошибок падает с 70% на трех файлах до жалких 5-30%, если затронуто больше десяти файлов. Модель физически не справляется с раздувшимся контекстом.
Команда из NeoLab собрала репозиторий Context Engineering Kit (CEK) как модульный маркетплейс скиллов и агентов. Их цель простая: снизить расход токенов, изолировать контекст отдельных подзадач и заставить ИИ-агентов писать код по строгим спецификациям, а не по наитию.
Что внутри набора
Набор оформлен по стандарту agentskills.io и нативно подключается к Claude Code, Gemini CLI, Cursor или Antigravity. Вместо того чтобы вываливать на модель одну огромную инструкцию на 20 страниц, CEK разбит на независимые плагины. Ставите только то, что нужно под конкретный рабочий процесс.
Команда разделила инструменты на несколько прикладных модулей:
- SDD (Spec-Driven Development): превращает написание кода в процесс, похожий на компиляцию. Сначала генерируется детальная спецификация по стандарту Arc42, затем декомпозируется на шаги, и только потом изолированные субагенты пишут код.
- SADD (Subagent-Driven Development): фреймворк запуска субагентов с отдельным агентом-судьей (LLM-as-Judge), который проверяет каждый шаг перед переходом к следующему.
- Reflexion: петли самопроверки и извлечения уроков. Команда
/reflectзаставляет модель перепроверить свое решение, а/memorizeсохраняет выводы в локальныйCLAUDE.md, чтобы агент не наступал на те же грабли в будущем. - Review: локальная замена платным сервисам вроде CodeRabbit. Запускает специализированных агентов для поиска багов, анализа безопасности и проверки контрактов API.
- FPF (First Principles Framework): модуль строгого логического вывода на базе идей Анатолия Левенчука. Агент строит конкурирующие гипотезы, проверяет ограничения и считает баллы доверия перед принятием архитектурных решений.
Как это работает на практике
Установка в Claude Code сводится к добавлению маркетплейса:
/plugin marketplace add NeoLabHQ/context-engineering-kit
/plugin install sdd@NeoLabHQ/context-engineering-kit
Если вы работаете через Cursor или другие редакторы, плагины можно затянуть через CLI:
npx skills add NeoLabHQ/context-engineering-kit
Самый практичный сценарий в проекте — цепочка спецификации и реализации. Когда нужно спроектировать сложную фичу, вы не просите ИИ сразу писать код. Сначала формулируется черновик:
/add-task "Спроектировать и внедрить middleware аутентификации с поддержкой JWT"
/plan-task .specs/tasks/draft/design-auth-middleware.feature.md
На этом этапе запускаются отдельные агенты. Исследователь анализирует зависимости, архитектор строит схему изменений, а бизнес-аналитик формирует строгие критерии приемки. Получается готовый markdown-файл с планом.
Дальше сессия очищается, чтобы сбросить накопленный шум, и запускается выполнение:
/implement-task @.specs/tasks/todo/design-auth-middleware.feature.md
Под капотом запускаются субагенты с чистым контекстом. Каждый из них реализует строго один шаг, прогоняет тесты и передает эстафету дальше. Если шаг провален, судья отправляет задачу на повторный круг, не загрязняя историю основного диалога.
Что под капотом
Вся механика опирается на свежие академические исследования в области надежности агентов. Авторы применили концепции Self-Refine, паттерн MAKER для очистки состояния агентов через файловую систему и методы верификации по рубрикам.
Главный фокус сделан на экономию внимания модели (attention budget). Если обычные системы расширений постоянно держат в контексте десятки инструкций, CEK загружает правила динамически. Например, плагин tech-stack автоматически внедряет гайдлайны по TypeScript только тогда, когда агент реально открывает или редактирует файлы с расширением .ts.
Кому проект пригодится
Если вы используете Claude Code или Cursor просто чтобы набросать одностраничный скрипт на Python, этот набор покажется избыточным. Запуск цепочки планирования и субагентов увеличивает расход токенов на отдельную задачу в 3-10 раз по сравнению с простым запросом.
Но если перед вами кодовая база на десятки тысяч строк, где любая правка цепляет смежные сервисы, такой подход окупается с первого раза. Вы тратите токены на оркестрацию и проверки, зато получаете код, который собирается и проходит тесты без бесконечных ручных правок. Начать знакомство проще всего с плагинов reflexion и review, а к тяжелой артиллерии вроде sdd переходить по мере усложнения задач.
