GPU Hot — Мониторинг видеокарт NVIDIA без головной боли

13 Jun, 2026
1,557
🔱 75
👥 2

Представьте ситуацию: у вас сервер с несколькими видеокартами NVIDIA, на котором идут вычисления. Вдруг нагрузка падает, но SSH доступ настроен только через jump-хост. Как быстро понять, что происходит? Знакомый сценарий? Проект GPU Hot решает эту проблему раз и навсегда.

Что это за инструмент?

GPU Hot — это легковесный веб-дашборд для мониторинга GPU NVIDIA в реальном времени. В отличие от стандартного nvidia-smi, который требует SSH доступа, это решение:

  • Работает через браузер
  • Обновляет данные каждые 0.5 секунды
  • Показывает исторические графики
  • Поддерживает мониторинг нескольких серверов
GPU Hot Dashboard

5 причин попробовать GPU Hot

  1. Простота развертывания — один Docker-контейнер, никаких сложных зависимостей:
docker run -d --gpus all -p 1312:1312 ghcr.io/psalias2006/gpu-hot:latest
  1. Полный контроль — отслеживайте:

    • Загрузку GPU и памяти
    • Температуру и энергопотребление
    • Частоты и состояние вентиляторов
    • Запущенные процессы (с опцией --pid=host)
  2. Масштабируемость — можно мониторить как один сервер, так и кластер из 100+ GPU. Для кластера:

# На каждом GPU-сервере
docker run -d --gpus all -p 1312:1312 -e NODE_NAME=$(hostname) ghcr.io/psalias2006/gpu-hot:latest

# На центральном сервере (без GPU)
docker run -d -p 1312:1312 -e GPU_HOT_MODE=hub -e NODE_URLS=http://server1:1312,... ghcr.io/psalias2006/gpu-hot:latest
  1. Гибкость — API для интеграции (REST и WebSocket) и настройка интервала обновления

    Реклама
  2. Поддержка старых GPU — работает даже с картами, где не поддерживается NVML (через флаг NVIDIA_SMI=true)

Технические особенности

Проект построен на:

  • Python (Flask) для бекенда
  • JavaScript (Chart.js) для визуализации
  • WebSocket для real-time обновлений
  • Docker для удобного развертывания

Архитектура модульная — можно легко добавить новые метрики или изменить интерфейс.

Кому особенно пригодится?

  • ML-инженерам — для мониторинга тренировочных процессов
  • DevOps — контроль за GPU-серверами в кластере
  • Гейм-девелоперам — тестирование производительности
  • Крипто-майнерам — отслеживание состояния ферм

Личный опыт

Я тестировал GPU Hot на сервере с 4x RTX 3090. Особенно порадовало:

  • Возможность видеть историю потребления энергии
  • Детализация по каждому процессу
  • Отсутствие лагов при высокой частоте обновления

GPU Hot — это must-have инструмент для всех, кто работает с NVIDIA GPU. Простота установки и богатый функционал делают его лучшей альтернативой стандартным средствам мониторинга. Если у вас есть сервер с видеокартами — попробуйте, не пожалеете.

P.S. Проект активно развивается — можно поучаствовать в разработке через GitHub.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.