Как дежурный ассистент Ongrid расследует инциденты прямо в мессенджерах

20 авг 2026
739
166
7
3 недели

Представьте типовую ситуацию на дежурстве. В три часа ночи звенит алерт: задержка ответов API подскочила в пять раз. Вы сонно открываете ноутбук, продираетесь через десяток дашбордов в Grafana, потом подключаетесь по SSH к нодам через бастион и судорожно грепаете логи. На поиск первопричины уходит полчаса, хотя дело было в одном упавшем поде или залипшей транзакции.

Авторы опенсорсного проекта Ongrid решили переложить эту рутину на связку из специализированных ИИ-агентов и готового стека наблюдаемости.

Ongrid demo

Что умеет система

Ongrid работает как автономный дежурный инженер. Он подключается к мессенджерам вроде Telegram или Slack, слушает входящие алерты и сразу начинает расследование.

Система построена на архитектуре координатора и узких специалистов. Когда прилетает алерт, главный агент создает воркер для анализа причин (Root Cause Analysis). Этот воркер опрашивает агентов по базам данных, сетям или SRE, собирает метрики, логи и трейсы, строит карту зависимостей и выдает в чат готовый отчет с указанием конкретной строчки кода или сбойного сервиса.

Реклама

Root cause analysis report

Безопасность и контроль доступа

Главный страх любого сисадмина при слове «агент в проде» — это галлюцинация модели, которая выполнит опасную команду и уронит базу. Разработчики Ongrid подошли к этому вопросу прагматично.

Во-первых, хостовые утилиты и песочница bash по умолчанию работают в режиме только для чтения. Агент может выполнить диагностические команды, посмотреть статус процессов или проверить состояние сокетов, но не станет молча перезагружать сервер.

Во-вторых, все потенциально деструктивные действия защищены специальным шлюзом подтверждения. Прежде чем применить исправление, бот запросит одобрение у дежурного инженера в чате или веб-интерфейсе.

Approval and write gate

В-третьих, хостам вообще не нужны открытые входящие порты. На целевые серверы ставится легковесный агент Edge, который сам устанавливает исходящее соединение с сервером Ongrid. Доступ через веб-терминал SSH работает по обратному туннелю, без проброса 22 порта наружу и без возни с ключами на бастионах. При этом каждый вызов логируется для аудита.

Наблюдаемость, топология и Kubernetes

Внутри коробки уже настроена связка из Prometheus, Loki, Tempo и Grafana. Разница в том, что запросы к ним пишет сам агент, сопоставляя временные метки событий с трейсами OpenTelemetry.

Monitoring

Недавно в проект добавили управление кластерами Kubernetes. Агент подключает кластеры через Edge, отслеживает события воркстейтов, помогает управлять апгрейдами и проецирует поды на общую карту топологии.

Kubernetes lifecycle management

Карта топологии помогает оценить радиус поражения инцидента. Если падает сетевой свитч или база данных, система визуализирует все зависящие сервисы, отсекая ложные срабатывания.

Topology map

База знаний и расширение навыков

Любая LLM бесполезна без контекста вашей инфраструктуры. Ongrid включает хранилище знаний, куда можно загрузить ранбуки, прошлые постмортемы и репозитории с кодом. Векторный поиск на базе Qdrant находит релевантные инструкции и скармливает их агенту во время разбора аварии.

Knowledge vault

Если стандартных инструментов не хватает, их можно добавить через протокол MCP (Model Context Protocol) или собрать собственный сценарий в визуальном редакторе воркфлоу.

MCP servers

Skills catalog

Workflow builder

Сгенерированные отчеты и дашборды сохраняются в центре артефактов, откуда ими удобно делиться с командой при разборе полетов.

Artifacts center

Под капотом и стек моделей

Бэкенд платформы написан на Go, а фронтенд собран на React и TypeScript. Решение можно развернуть полностью на своих серверах под лицензией AGPLv3.

Что касается языковых моделей, проект не привязан к одному вендору. Вы можете использовать Claude от Anthropic, OpenAI, DeepSeek, Gemini или локальные инстансы, переключая роутинг моделей на лету в зависимости от сложности задачи.

Как развернуть на своем сервере

Установка на Ubuntu, Debian или Rocky Linux выполняется готовым скриптом:

# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh

Для ARM64 достаточно заменить имя архива на соответствующий релиз. Скрипт поднимет серверную часть и веб-интерфейс, после чего останется настроить подключение к мессенджеру и поставить агент Edge на хосты.

Кому стоит попробовать

Ongrid пригодится небольшим и средним командам эксплуатации, где нет круглосуточного дежурного центра мониторинга (NOC), а разработчики дежурят по очереди. Он снимает первую волну паники при инциденте, сразу собирая логи и локализуя проблему до понятного резюме.

Проект пока свежий (около 700 звезд на GitHub), но архитектурно выглядит зрело за счет упора на безопасность и использование открытых стандартов телеметрии.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.