Локальный ElevenLabs на собственном железе с VoiceStudio

23 авг 2026
11,223
1,788
58
3 недели

Недавно мне понадобилось озвучить пару десятков обучающих видеороликов и нарезать субтитры. Первая мысль — пойти в облачные сервисы вроде ElevenLabs. Но когда считаешь ценник за подписку на команду и понимаешь, что черновой звук и конфиденциальные материалы улетят на чужие сервера, энтузиазм угасает.

На GitHub как раз набрал популярность проект VoiceStudio (раньше он назывался OmniVoice-Studio). Это десктопное приложение для синтеза, клонирования голоса, транскрипции и дубляжа, которое крутится локально.

Логотип VoiceStudio

Никаких токенов, кредитов за генерацию или обязательной привязки карты. Вы скачиваете приложение, оно подтягивает нужные веса моделей, и вся обработка идет на вашей видеокарте или процессоре.

Что умеет приложение

В репозитории собрали почти все заметные открытые наработки в области звука за последнее время. Вместо того чтобы разворачивать десяток отдельных блокнотов в Jupyter или возиться с несовместимыми версиями PyTorch, вы получаете готовую графическую оболочку и локальный сервер.

Реклама

Переключение движков в VoiceStudio

Вот основные сценарии, которые закрывает программа:

  1. Клонирование голоса. Работает в режиме zero-shot: берете короткий референсный отрезок аудио на 5–15 секунд без шума и музыки, вводите текст и получаете готовую дорожку с тем же тембром.
  2. Дизайн голоса. Если готового образца нет, параметры задаются текстом: возраст, акцент, тон, эмоциональная окраска или особенности дикции.
  3. Автоматический дубляж видео. Инструмент умеет распознавать речь в видеоряде, переводить ее, разделять спикеров через диаризацию, накладывать синтезированный голос поверх оригинальной дорожки и сразу экспортировать готовый файл.
  4. Аудиокниги и длинные истории. Можно загрузить файл в формате EPUB или PDF, распределить реплики между разными виртуальными дикторами, отрендерить главы и собрать итоговую книгу в формате .m4b.
  5. Системный виджет диктовки. По нажатию глобального хоткея голос с микрофона транскрибируется в текст на лету, а локальная языковая модель может тут же подчистить слова-паразиты и расставить знаки препинания.

Встроенный каталог моделей дает переключаться между 16 движками синтеза речи и 11 движками распознавания прямо на лету комбинацией клавиш.

Каталог моделей и галерея голосов

Под капотом и в терминале

Архитектура проекта сделана разумно. Разработчики не стали заворачивать все в тяжелый Electron.

  • Десктопная оболочка: Tauri v2 на Rust, который отвечает за системный трей, вызовы хоткеев и управление фоновыми процессами.
  • Интерфейс: React с бандлером Vite и стейт-менеджером Zustand.
  • Бэкенд: FastAPI на Python, поднимающийся на порту 3900. Внутри него крутятся адаптеры моделей, очереди задач и база данных SQLite с миграциями через Alembic.

Среди движков синтеза речи заявлена поддержка 646 языков через k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS и MOSS-TTS. Для транскрипции доступны WhisperX, Faster-Whisper, Parakeet TDT и FunASR. Звуковые дорожки при необходимости разделяются с помощью Demucs, а спикеры определяются через Pyannote.

Если интерфейс вам не нужен, а звук хочется генерировать из скриптов, бэкенд отдает совместимый с OpenAI API. Достаточно перенаправить базовый URL в клиенте:

from openai import OpenAI

# Подключаемся к локальному бэкенду VoiceStudio
client = OpenAI(
    base_url="http://localhost:3900/v1",
    api_key="local"
)

with client.audio.speech.with_streaming_response.create(
    model="tts-1",
    voice="custom-voice-profile-id",
    input="Текст для синтеза на локальном железе без облаков.",
    response_format="wav",
) as response:
    response.stream_to_file("output.wav")

Кроме стандартного REST API поддерживаются WebSocket, Server-Sent Events и протокол MCP (Model Context Protocol). Это значит, что синтез и распознавание речи можно вызывать напрямую как инструмент для ИИ-агентов в Claude Code или Cursor.

Требования к железу и установка

Для быстрого старта авторы подготовили готовые сборки:

  • macOS: DMG-пакет под Apple Silicon (поддерживаются бэкенды MPS и MLX). На старых процессорах Intel локальный бэкенд работать не будет.
  • Windows: MSI-установщик под 64-битные системы с ускорением на CUDA.
  • Linux: AppImage-пакет и готовые Docker-контейнеры с поддержкой CUDA и ROCm.

При первом запуске программа сама разворачивает изолированное Python-окружение и скачивает базовую модель.

Минимум для комфортной работы — 8 ГБ оперативной памяти и 4 ГБ видеопамяти при запуске на GPU. Если видеокарты нет, базовые модели работают и на CPU, но генерация длинных отрезков займет заметно больше времени. Для тяжелых моделей вроде CosyVoice 3 лучше иметь карту с 8–16 ГБ VRAM.

Если хотите запустить проект из исходников, понадобятся bun и Python:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

Для запуска только веб-интерфейса в браузере используйте команду bun run dev.

Кому пригодится

Проект явно понравится тем, кто регулярно работает с аудиоконтентом, но не хочет сливать данные во внешние облака. Это отличная находка для локализации подкастов, автоматической озвучки документации, озвучивания инди-игр или быстрой локальной расшифровки митингов без ограничений по длительности.

Код распространяется под лицензией AGPL-3.0, а базовые модели поставляются под Apache-2.0. Если искали автономный аудио-комбайн для рабочего стола, VoiceStudio определенно стоит установить и покрутить.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.