Как выжать максимум токенов из связки RTX 3090
Подержанная карта RTX 3090 на 24 ГБ остается самым доступным билетом в мир локальных нейросетей. Если поставить в материнскую плату две такие карты, суммарные 48 ГБ видеопамяти на бумаге дают простор для запуска моделей уровня Qwen 27B или компактных MoE. В реальности запуск часто упирается в технические тупики. То vLLM падает в Out of Memory на длинных промптах, то спекулятивное декодирование сбоит из-за захвата CUDA-графов, то квантованные веса выдают мусор.
Собрать рабочий стек инференса без просадок по скорости и внезапных падений — задача на пару бессонных недель. Недавно на GitHub появился проект club-3090, который берет эту рутину на себя.
Готовые рецепты для домашнего сервера инференса
Проект представляет собой коллекцию выверенных конфигураций Docker Compose, скриптов автоматизации, готовых патчей и бенчмарков. Авторы откалибровали настройки под архитектуру Ampere и 24-гигабайтный лимит памяти каждой карты.
Команда репозитория проверила совместимость и на более свежих картах, включая 4090 и 5090. Основной фокус сделан именно на 3090, где видеопамять приходится экономить буквально до мегабайта.
На выходе вы получаете локальный сервис с интерфейсом OpenAI API на порту 8020. К нему можно сразу подключать плагин в редакторе кода или консольные утилиты вроде Aider.
Скорость против надежности
Разработчики репозитория отказались от идеи сделать один универсальный конфиг на все случаи жизни. Вместо этого они выделили два противоположных сценария работы.
Первый сценарий рассчитан на максимальную пропускную способность. Он запускает vLLM на двух видеокартах с тензорным параллелизмом. Внутрь вшиты кванты AutoRound INT4 и спекулятивное декодирование через MTP или DFlash. На модели Qwen3.6-27B такая конфигурация выдает до 127 токенов в секунду при генерации кода. Это быстрее ответов многих платных облачных сервисов.
Второй сценарий создан для стабильности и работы на одной карте. Здесь задействован движок llama.cpp или его форк ik_llama с форматами Q4_K_M и IQ4_KS. Скорость генерации скромнее, около 50-60 токенов в секунду. Зато связка уверенно держит контекст до 200 тысяч токенов без риска упасть от нехватки памяти при длинных системных промптах.

Управление запуском и терминальный пульт
Запускать тяжелые модели вручную через километровые команды docker run неудобно. В club-3090 подготовлен интерактивный мастер, который сам проверяет доступную память и скачивает проверенные веса.
# Клонируем проект
git clone https://github.com/noonghunna/club-3090.git
cd club-3090
# Скачиваем веса выбранной модели
bash scripts/setup.sh qwen3.6-27b
# Запускаем мастер настройки и старта
bash scripts/launch.sh
Мастер рассчитывает бюджет KV-кэша под размер контекста и сразу поднимает контейнер.
Любителям визуального контроля авторы предлагают утилиту c3. Это терминальный интерфейс, напоминающий lazydocker. Через него можно в реальном времени следить за температурой и памятью видеокарт, проверять статус контейнеров, переключать конфигурации нажатием одной кнопки и запускать тесты здоровья сервиса.
# Установка пульта управления через uv
uv pip install -e tools/serve-cockpit
# Запуск интерфейса
c3
Борьба с подводными камнями инференса
Самая ценная часть проекта скрыта в документации и патчах. Разработчики детально изучили границы стабильности моделей на 24 ГБ памяти.
В vLLM давно известна проблема падения по OOM на этапе prefill, когда на вход подается длинный промпт более 50 тысяч токенов. В документации проекта этот эффект называют обрывом памяти. Для каждого сценария авторы замерили точные границы безопасной работы и добавили обходные пути.
Репозиторий включает комплекс стресс-тестов:
- Проверка многочасовой стабильности без утечек памяти при работе агентов
- Тестирование качества вызова инструментов и следования инструкциям
- Бенчмарк реальной скорости генерации с замером задержек p50 и p95
- Проверка устойчивости к длинному контексту на синтетических задачах
Какие модели готовы к работе
Каталог сосредоточен на моделях, которые дают максимальную отдачу на доступном железе:
- Qwen3.6-27B с поддержкой визуального ввода и инструментов
- Gemma 4 31B с контекстом до 262K токенов
- Qwen3.6 35B-A3B на архитектуре MoE с тремя миллиардами активных параметров
- Gemma 4 26B-A4B в квантовании AWQ
Для сторонних моделей из Hugging Face есть скрипт универсальной оценки. Он анализирует архитектуру весов safetensors и выдает вердикт, влезет ли модель в вашу конфигурацию карт с учетом KV-кэша.
Кому пригодится проект
Если вы держите дома или в офисе сервер на базе RTX 3090, 4090 или 5090 для локальной разработки, этот репозиторий сэкономит вам массу времени. Вы получаете проверенные образы, готовые настройки параллелизма и честные цифры производительности без маркетинговых прикрас.
Для запуска понадобится Linux (или WSL2 на Windows), установленный Docker с поддержкой NVIDIA Container Toolkit и свежие драйверы NVIDIA 580-й серии.
