GPU Hot — Мониторинг видеокарт NVIDIA без головной боли
Представьте ситуацию: у вас сервер с несколькими видеокартами NVIDIA, на котором идут вычисления. Вдруг нагрузка падает, но SSH доступ настроен только через jump-хост. Как быстро понять, что происходит? Знакомый сценарий? Проект GPU Hot решает эту проблему раз и навсегда.
Что это за инструмент?
GPU Hot — это легковесный веб-дашборд для мониторинга GPU NVIDIA в реальном времени. В отличие от стандартного nvidia-smi, который требует SSH доступа, это решение:
- Работает через браузер
- Обновляет данные каждые 0.5 секунды
- Показывает исторические графики
- Поддерживает мониторинг нескольких серверов
5 причин попробовать GPU Hot
- Простота развертывания — один Docker-контейнер, никаких сложных зависимостей:
docker run -d --gpus all -p 1312:1312 ghcr.io/psalias2006/gpu-hot:latest
-
Полный контроль — отслеживайте:
- Загрузку GPU и памяти
- Температуру и энергопотребление
- Частоты и состояние вентиляторов
- Запущенные процессы (с опцией
--pid=host)
-
Масштабируемость — можно мониторить как один сервер, так и кластер из 100+ GPU. Для кластера:
# На каждом GPU-сервере
docker run -d --gpus all -p 1312:1312 -e NODE_NAME=$(hostname) ghcr.io/psalias2006/gpu-hot:latest
# На центральном сервере (без GPU)
docker run -d -p 1312:1312 -e GPU_HOT_MODE=hub -e NODE_URLS=http://server1:1312,... ghcr.io/psalias2006/gpu-hot:latest
-
Гибкость — API для интеграции (REST и WebSocket) и настройка интервала обновления
-
Поддержка старых GPU — работает даже с картами, где не поддерживается NVML (через флаг
NVIDIA_SMI=true)
Технические особенности
Проект построен на:
- Python (Flask) для бекенда
- JavaScript (Chart.js) для визуализации
- WebSocket для real-time обновлений
- Docker для удобного развертывания
Архитектура модульная — можно легко добавить новые метрики или изменить интерфейс.
Кому особенно пригодится?
- ML-инженерам — для мониторинга тренировочных процессов
- DevOps — контроль за GPU-серверами в кластере
- Гейм-девелоперам — тестирование производительности
- Крипто-майнерам — отслеживание состояния ферм
Личный опыт
Я тестировал GPU Hot на сервере с 4x RTX 3090. Особенно порадовало:
- Возможность видеть историю потребления энергии
- Детализация по каждому процессу
- Отсутствие лагов при высокой частоте обновления
GPU Hot — это must-have инструмент для всех, кто работает с NVIDIA GPU. Простота установки и богатый функционал делают его лучшей альтернативой стандартным средствам мониторинга. Если у вас есть сервер с видеокартами — попробуйте, не пожалеете.
P.S. Проект активно развивается — можно поучаствовать в разработке через GitHub.
