Step-Audio - Универсальный фреймворк для голосового ИИ, который удивит даже скептиков
Репозиторий был удален
Но вы можете попробовать восстановить данные из глобального архива.
Почему все говорят о Step-Audio?
Представьте: голосовой ассистент, который не просто понимает ваши слова, но и отвечает с нужной интонацией — радостно, грустно или даже читает рэп. И делает это на китайском, английском или японском с региональным акцентом. Звучит как фантастика? Команда stepfun-ai сделала это реальностью, выпустив open-source фреймворк Step-Audio.
Что умеет Step-Audio?
1. Мультимодальная модель на 130 млрд параметров
Step-Audio объединяет в одной архитектуре:
- Распознавание речи (ASR)
- Семантическое понимание
- Диалоговые возможности
- Генерацию речи (TTS)
- Клонирование голоса
Особенно впечатляет поддержка:
- Эмоциональных тонов (радость, грусть, гнев)
- Региональных диалектов (кантонский, сычуаньский)
- Разных стилей речи (рэп, акапельное пение)
2. Генеративный Data Engine
Больше не нужны тонны размеченных данных — модель сама генерирует обучающие примеры. Это позволило создать компактную 3B-версию TTS с отличным качеством.
3. Тонкий контроль голоса
Хотите, чтобы ассистент говорил быстро, медленно или с конкретной эмоцией? Step-Audio понимает инструкции типа:
"Скажи это грустным голосом" "Произнеси как рэп" "Говори медленнее"
Технические особенности
Двойное токенизирование

Step-Audio использует два параллельных токенизатора:
- Семантический (16.7Hz, кодбук 1024)
- Акустический (25Hz, кодбук 4096)
Такая архитектура позволяет сохранять и смысл, и нюансы звучания.
Режимы работы
- Step-Audio-Chat (130B) — полноценный голосовой ассистент
- Step-Audio-TTS-3B — компактный синтезатор речи
- Step-Audio-Tokenizer — обработка аудиопотоков
Как попробовать?
Для запуска потребуется серьезное железо:
- Минимум 4 GPU A800/H800 с 80GB памяти
- Поддержка CUDA
Установка проста:
git clone https://github.com/stepfun-ai/Step-Audio.git
cd Step-Audio
pip install -r requirements.txt
Или через Docker:
docker build . -t step-audio
docker run --rm -ti --gpus all step-audio
Кому это нужно?
- Разработчикам голосовых ассистентов
- Создателям аудиоконтента
- Исследователям в области NLP
- Командам, работающим с мультиязычными проектами
Step-Audio — это серьезный шаг в развитии голосовых технологий. Хотите услышать, как это работает? Загляните в онлайн-демо или скачайте модели с HuggingFace.
