Step-Audio - Универсальный фреймворк для голосового ИИ, который удивит даже скептиков

28 июл 2025

Репозиторий был удален

Но вы можете попробовать восстановить данные из глобального архива.

4,620
370
42
6 месяцев

Почему все говорят о Step-Audio?

Представьте: голосовой ассистент, который не просто понимает ваши слова, но и отвечает с нужной интонацией — радостно, грустно или даже читает рэп. И делает это на китайском, английском или японском с региональным акцентом. Звучит как фантастика? Команда stepfun-ai сделала это реальностью, выпустив open-source фреймворк Step-Audio.

Что умеет Step-Audio?

1. Мультимодальная модель на 130 млрд параметров

Step-Audio объединяет в одной архитектуре:

  • Распознавание речи (ASR)
  • Семантическое понимание
  • Диалоговые возможности
  • Генерацию речи (TTS)
  • Клонирование голоса

Особенно впечатляет поддержка:

  • Эмоциональных тонов (радость, грусть, гнев)
  • Региональных диалектов (кантонский, сычуаньский)
  • Разных стилей речи (рэп, акапельное пение)

2. Генеративный Data Engine

Больше не нужны тонны размеченных данных — модель сама генерирует обучающие примеры. Это позволило создать компактную 3B-версию TTS с отличным качеством.

3. Тонкий контроль голоса

Хотите, чтобы ассистент говорил быстро, медленно или с конкретной эмоцией? Step-Audio понимает инструкции типа:

Реклама

"Скажи это грустным голосом" "Произнеси как рэп" "Говори медленнее"

Технические особенности

Двойное токенизирование

Архитектура токенизатора

Step-Audio использует два параллельных токенизатора:

  • Семантический (16.7Hz, кодбук 1024)
  • Акустический (25Hz, кодбук 4096)

Такая архитектура позволяет сохранять и смысл, и нюансы звучания.

Режимы работы

  1. Step-Audio-Chat (130B) — полноценный голосовой ассистент
  2. Step-Audio-TTS-3B — компактный синтезатор речи
  3. Step-Audio-Tokenizer — обработка аудиопотоков

Как попробовать?

Для запуска потребуется серьезное железо:

  • Минимум 4 GPU A800/H800 с 80GB памяти
  • Поддержка CUDA

Установка проста:

git clone https://github.com/stepfun-ai/Step-Audio.git
cd Step-Audio
pip install -r requirements.txt

Или через Docker:

docker build . -t step-audio
docker run --rm -ti --gpus all step-audio

Кому это нужно?

  • Разработчикам голосовых ассистентов
  • Создателям аудиоконтента
  • Исследователям в области NLP
  • Командам, работающим с мультиязычными проектами

Step-Audio — это серьезный шаг в развитии голосовых технологий. Хотите услышать, как это работает? Загляните в онлайн-демо или скачайте модели с HuggingFace.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.