Голоса будущего из одного репозитория - как работает семейство моделей MOSS-TTS
Знаете это чувство, когда пытаешься собрать нормальный голосовой интерфейс, а в итоге получаешь либо робота из восьмидесятых, либо монструозную систему, которая съедает всю видеопамять еще до того, как произнесет первое «Привет»? Недавно я наткнулся на проект MOSS-TTS от команды OpenMOSS, и, кажется, ребята решили закрыть вообще все боли разработчиков, связанных со звуком.
Это не просто очередная «говорилка». Перед нами целое семейство моделей, которые умеют не только синтезировать речь, но и клонировать голоса, создавать звуковые эффекты и даже работать в реальном времени с минимальной задержкой.

Что внутри этого набора
Разработчики из OpenMOSS не стали пытаться впихнуть невпихуемое в одну нейронку. Они разделили задачи на пять специализированных инструментов. Такой подход мне импонирует: если вам нужны только звуки леса для игры, вам не придется тащить за собой тяжелую модель для диалогов.
MOSS-TTS: флагман для продакшена
Это основная рабочая лошадка. Она умеет клонировать голос по короткому сэмплу (zero-shot) и, что редкость, стабильно выдает длинные тексты. Обычно TTS-системы начинают «плыть» или менять интонацию через пару минут чтения, но здесь заявлена высокая стабильность. Плюс есть тонкий контроль: можно руками поправить пиньинь, фонемы или длительность пауз.
MOSS-TTSD: мастер диалогов
Если вы когда-нибудь слушали подкасты, сгенерированные нейронками, то знаете, как неестественно звучит переход между спикерами. TTSD заточена именно под диалоги. В тестах она обходит даже закрытые решения вроде Gemini 2.5-pro по естественности интонаций.
MOSS-VoiceGenerator: дизайнер голосов
Самая любопытная штука. Ей не нужен референсный файл. Вы просто пишете текстом: «Голос пожилого мужчины с хрипотцой, который говорит медленно и устало», и модель генерирует этот тембр с нуля. Это киллер-фича для геймдева, когда нужно озвучить сотню NPC, а бюджет на актеров ограничен.
MOSS-SoundEffect: генератор окружения
Тут все просто: текст на входе — звук на выходе. Гроза, шум шоссе, рычание мотора или звуки шагов. Работает на архитектуре DiT (Diffusion Transformer), выдает честные 48 кГц.
MOSS-TTS-Realtime: для быстрых агентов
Главная проблема голосовых помощников — задержка. Пока LLM думает, а TTS генерирует, проходит вечность. Эта модель выдает первый байт звука через 180 мс. В связке с быстрой текстовой моделью получается вполне живое общение.
Как это запустить
Для старта ребята рекомендуют Python 3.12. Установка стандартная, но есть нюанс с зависимостями — они жестко зафиксированы под конкретные версии PyTorch, чтобы ничего не развалилось.
git clone https://github.com/OpenMOSS/MOSS-TTS.git
cd MOSS-TTS
pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e ".[torch-runtime]"
Если у вас карта серии RTX 30+ или 40+, обязательно ставьте FlashAttention 2. Это реально экономит видеопамять и ускоряет генерацию.
Пример кода для базового синтеза выглядит человечно. Никаких трехэтажных конфигов, всё через processor и model.generate:
from transformers import AutoModel, AutoProcessor
import torch
# Загружаем модель (в примере версия 1.5)
model_name = "OpenMOSS-Team/MOSS-TTS-v1.5"
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(model_name, trust_remote_code=True).to("cuda")
# Текст с управлением паузой
text = "Я сегодня выучил стихотворение, оно называется [pause 3.2s] Тишина."
# Собираем сообщение
msg = processor.build_user_message(text=text, language="Russian")
inputs = processor([msg], mode="generation")
# Генерируем аудио
with torch.no_grad():
outputs = model.generate(**inputs.to("cuda"), max_new_tokens=4096)
Железо и оптимизация
8-миллиардная модель (флагманская) требует ресурсов, но разработчики добавили поддержку llama.cpp. Это значит, что её можно запустить без PyTorch вообще, используя квантованные веса GGUF. На видеокартах с 8 ГБ VRAM модель вполне помещается, если использовать оптимизированные конфиги.
Для тех, кому нужно «дешево и сердито», есть MOSS-TTS-Nano. Это крошка на 100 миллионов параметров, которая выдает 48 кГц стерео даже на обычном четырехъядерном процессоре. Качество клонирования там попроще, но для локальных задач — выше крыши.
Почему это важно
Проект OpenMOSS интересен тем, что они выложили в открытый доступ не только веса, но и архитектурные подробности. Например, их аудио-токенизатор MOSS-Audio-Tokenizer обучен на 3 миллионах часов аудио. Это огромный датасет, который включает музыку, речь и шумы.

В отличие от многих других open-source проектов, которые поддерживают только английский и китайский, MOSS-TTS v1.5 из коробки понимает 31 язык, включая русский. Причем поддержка русского здесь не «для галочки» — интонации и ударения отрабатывают корректно.
Итог: стоит ли пробовать?
Если вы пишите своего голосового ассистента, делаете озвучку для видео или просто хотите поиграть с генерацией звука — однозначно да.
Кому проект зайдет больше всего:
- Разработчикам голосовых ботов: за счет Realtime-модели с низким TTFB.
- Инди-хакерам: Nano-версия позволяет делать крутые штуки без аренды дорогих GPU.
- Исследователям: архитектура MossTTSDelay и MossTTSLocal — отличные референсы для изучения того, как сейчас устроен современный TTS.
Из минусов — документация местами заставляет лезть в код, а первая компиляция через SGLang может затянуться. Но учитывая качество звука на выходе, это вполне приемлемая цена. Ссылка на репозиторий: OpenMOSS/MOSS-TTS.
