Как распознать речь на 31 языке без Python и GPU

22 Jul, 2026
1,417
🔱 139
👥 10

Знакомая история: нужно добавить в проект распознавание речи (ASR), вы скачиваете Whisper, а он либо съедает всю видеопамять, либо заставляет тянуть за собой гигабайты зависимостей Python. Если проект должен работать на «железе» попроще или в реальном времени, начинаются танцы с бубном. Команда из Tongyi Lab выкатила Fun-ASR, и кажется, они решили сразу несколько наболевших проблем.

Что это такое

Fun-ASR — это большая модель распознавания речи, которую обучали на десятках миллионов часов реальных записей. Главная фишка здесь не только в точности, но и в адаптивности. Проект поддерживает 31 язык и, что редкость для опенсорсных решений, отлично справляется с диалектами и акцентами.

Разработчики сделали ставку на промышленное использование. Это значит, что модель не просто переводит звук в текст, но и умеет работать в условиях сильного шума, понимать профессиональную терминологию из финансов или образования и не «галлюцинировать», когда спикер внезапно переходит с одного языка на другой.

Почему на это стоит взглянуть

Если сравнивать с тем же Whisper, у Fun-ASR есть несколько козырей, которые пригодятся в реальной разработке.

Работа без Python и GPU

Это, пожалуй, самое интересное обновление последнего времени. Авторы добавили поддержку llama.cpp. Теперь Fun-ASR-Nano можно запустить как один бинарный файл. Никакого PyTorch в рантайме, никаких проблем с версиями библиотек. Квантованная модель весит около 484 МБ и спокойно крутится на обычном процессоре.

Скорость через vLLM

Для тех, кому нужно обрабатывать огромные архивы записей на сервере, внедрили интеграцию с vLLM. Тесты показывают, что пакетная обработка (batch inference) работает в 3-5 раз быстрее стандартных методов. Если использовать специфические оптимизации движка, можно разогнать процесс до 340x относительно реального времени. То есть час записи расшифровывается буквально за секунды.

Диалекты и акценты

Обычно модели хорошо понимают «литературный» язык, но теряются на региональных говорах. Fun-ASR поддерживает 7 крупных китайских диалектов и 26 акцентов. Для английского и японского тоже заявлена глубокая проработка региональных особенностей. В российских реалиях это может быть полезно для распознавания речи в специфических акустических условиях или при работе с международными командами.

Распознавание текста песен

Неочевидная, но крутая фича — модель специально дообучали отделять вокал от музыки. Она умеет вычленять лирику даже под тяжелый бит или сложный инструментал, где обычные ASR часто выдают бессвязный набор слов.

Как это запустить

Для быстрого старта на Python достаточно стандартного набора:

from funasr import AutoModel

model = AutoModel(
    model="FunAudioLLM/Fun-ASR-Nano-2512",
    vad_model="fsmn-vad",
    punc_model="ct-punc",
    device="cuda:0",
    hub="hf"
)

res = model.generate(input="audio.mp3", language="中文")
print(res[0]["text"])

Заметьте, что в примере выше сразу подключаются модули VAD (детектор активности голоса) и расстановка пунктуации. Это избавляет от необходимости писать свои костыли для нарезки длинных аудио на куски.

Если же вам нужно запустить модель на «голом» железе через CLI:

llama-funasr-cli --enc ./funasr-encoder-f16.gguf -m ./qwen3-0.6b-q8_0.gguf -a audio.wav --vad ./fsmn-vad.gguf

Разделение спикеров и микросервисы

В проекте «из коробки» есть поддержка Speaker Diarization. Модель не просто пишет текст, а помечает: «Спикер 1 сказал это, а Спикер 2 — то». Это критично для записи совещаний или интервью.

Для продакшена предусмотрен готовый сценарий с WebSocket-сервером. Вы запускаете серверную часть, и она может принимать потоковое аудио, возвращая текст в реальном времени. Есть даже готовый HTML-клиент для проверки работы микрофона прямо в браузере.

Результаты тестов

В README приведена огромная таблица сравнения с другими моделями (Whisper-large-v3, GLM-ASR и др.). Если отбросить маркетинговую шелуху, цифры выглядят достойно: на сложных записях с фоновым шумом Fun-ASR показывает процент ошибок (WER) в районе 5.79%, тогда как Whisper в тех же условиях улетает за 22%.

Особенно заметен отрыв в распознавании речи на большом расстоянии от микрофона (Far-field).

Итог: стоит ли пробовать

Fun-ASR — это не просто очередная обертка над трансформерами. Это рабочий инструмент для тех, кто перерос базовые возможности Whisper и ищет что-то более эффективное для хайлоада или edge-устройств.

Кому проект пригодится в первую очередь:

  • Разработчикам систем для колл-центров и аналитики звонков.
  • Создателям приложений для транскрибации видео и создания субтитров.
  • Тем, кто делает умные устройства, где нет лишних гигабайт памяти под тяжелые нейросети.

Из минусов можно отметить, что основная документация и фокус модели все еще смещены в сторону азиатских языков, но поддержка английского и формат GGUF делают проект универсальным. Если вам нужно быстрое и «всеядное» распознавание речи, Fun-ASR определенно заслуживает места в закладках.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.