Как дежурный ассистент Ongrid расследует инциденты прямо в мессенджерах
Представьте типовую ситуацию на дежурстве. В три часа ночи звенит алерт: задержка ответов API подскочила в пять раз. Вы сонно открываете ноутбук, продираетесь через десяток дашбордов в Grafana, потом подключаетесь по SSH к нодам через бастион и судорожно грепаете логи. На поиск первопричины уходит полчаса, хотя дело было в одном упавшем поде или залипшей транзакции.
Авторы опенсорсного проекта Ongrid решили переложить эту рутину на связку из специализированных ИИ-агентов и готового стека наблюдаемости.
Что умеет система
Ongrid работает как автономный дежурный инженер. Он подключается к мессенджерам вроде Telegram или Slack, слушает входящие алерты и сразу начинает расследование.
Система построена на архитектуре координатора и узких специалистов. Когда прилетает алерт, главный агент создает воркер для анализа причин (Root Cause Analysis). Этот воркер опрашивает агентов по базам данных, сетям или SRE, собирает метрики, логи и трейсы, строит карту зависимостей и выдает в чат готовый отчет с указанием конкретной строчки кода или сбойного сервиса.
Безопасность и контроль доступа
Главный страх любого сисадмина при слове «агент в проде» — это галлюцинация модели, которая выполнит опасную команду и уронит базу. Разработчики Ongrid подошли к этому вопросу прагматично.
Во-первых, хостовые утилиты и песочница bash по умолчанию работают в режиме только для чтения. Агент может выполнить диагностические команды, посмотреть статус процессов или проверить состояние сокетов, но не станет молча перезагружать сервер.
Во-вторых, все потенциально деструктивные действия защищены специальным шлюзом подтверждения. Прежде чем применить исправление, бот запросит одобрение у дежурного инженера в чате или веб-интерфейсе.
В-третьих, хостам вообще не нужны открытые входящие порты. На целевые серверы ставится легковесный агент Edge, который сам устанавливает исходящее соединение с сервером Ongrid. Доступ через веб-терминал SSH работает по обратному туннелю, без проброса 22 порта наружу и без возни с ключами на бастионах. При этом каждый вызов логируется для аудита.
Наблюдаемость, топология и Kubernetes
Внутри коробки уже настроена связка из Prometheus, Loki, Tempo и Grafana. Разница в том, что запросы к ним пишет сам агент, сопоставляя временные метки событий с трейсами OpenTelemetry.
Недавно в проект добавили управление кластерами Kubernetes. Агент подключает кластеры через Edge, отслеживает события воркстейтов, помогает управлять апгрейдами и проецирует поды на общую карту топологии.
Карта топологии помогает оценить радиус поражения инцидента. Если падает сетевой свитч или база данных, система визуализирует все зависящие сервисы, отсекая ложные срабатывания.
База знаний и расширение навыков
Любая LLM бесполезна без контекста вашей инфраструктуры. Ongrid включает хранилище знаний, куда можно загрузить ранбуки, прошлые постмортемы и репозитории с кодом. Векторный поиск на базе Qdrant находит релевантные инструкции и скармливает их агенту во время разбора аварии.
Если стандартных инструментов не хватает, их можно добавить через протокол MCP (Model Context Protocol) или собрать собственный сценарий в визуальном редакторе воркфлоу.
Сгенерированные отчеты и дашборды сохраняются в центре артефактов, откуда ими удобно делиться с командой при разборе полетов.
Под капотом и стек моделей
Бэкенд платформы написан на Go, а фронтенд собран на React и TypeScript. Решение можно развернуть полностью на своих серверах под лицензией AGPLv3.
Что касается языковых моделей, проект не привязан к одному вендору. Вы можете использовать Claude от Anthropic, OpenAI, DeepSeek, Gemini или локальные инстансы, переключая роутинг моделей на лету в зависимости от сложности задачи.
Как развернуть на своем сервере
Установка на Ubuntu, Debian или Rocky Linux выполняется готовым скриптом:
# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh
Для ARM64 достаточно заменить имя архива на соответствующий релиз. Скрипт поднимет серверную часть и веб-интерфейс, после чего останется настроить подключение к мессенджеру и поставить агент Edge на хосты.
Кому стоит попробовать
Ongrid пригодится небольшим и средним командам эксплуатации, где нет круглосуточного дежурного центра мониторинга (NOC), а разработчики дежурят по очереди. Он снимает первую волну паники при инциденте, сразу собирая логи и локализуя проблему до понятного резюме.
Проект пока свежий (около 700 звезд на GitHub), но архитектурно выглядит зрело за счет упора на безопасность и использование открытых стандартов телеметрии.
