#speech-recognition
Изучите технологии распознавания речи: от обзоров популярных библиотек, таких как Whisper и Vosk, до проектов для создания оффлайн-голосовых ассистентов. Узнайте, как интегрировать синтез и обработку голоса в свои приложения и обеспечить приватность данных пользователей.
Как распознавать речь в 15 раз быстрее Whisper и сразу понимать эмоции
Обзор SenseVoice: неавторегрессионная модель распознавания речи от QwenAudio, работающая в 15 раз быстрее Whisper. Распознает текст, эмоции и фоновые...
Как поднять быстрый инференс для голосовых и мультимодальных моделей с SGLang-Omni
Разбираем SGLang-Omni — специализированный runtime для быстрого многостадийного инференса omni-, TTS- и ASR-моделей с поддержкой OpenAI API.
Как распознавать русскую речь точнее Whisper с помощью GigaAM
Разбираем открытое семейство акустических моделей GigaAM для распознавания русской речи, превосходящее Whisper по качеству и скорости работы.
Как не утонуть в море курсов по нейросетям и найти действительно стоящие лекции
Обзор огромной библиотеки бесплатных курсов по машинному обучению от топовых университетов мира: от основ математики до графовых нейросетей.
Как запустить мультимодальный ИИ на своем ноутбуке без облаков и лишних трат
Обзор Parlor — опенсорсного проекта для запуска мультимодального ИИ (зрение + голос) локально на вашем компьютере. Разбираем архитектуру на базе Gemma...
Как добавить голосовое управление на сайт с помощью библиотеки annyang
Обзор крошечной JS-библиотеки annyang, которая позволяет добавить голосовое управление на сайт всего парой строк кода. Разбираемся, как это работает н...
Как распознать речь на 31 языке без Python и GPU
Обзор Fun-ASR: мощной модели распознавания речи с поддержкой 31 языка, оптимизацией для CPU через llama.cpp и высокой скоростью благодаря vLLM.
Как научить Whisper различать голоса - разбираем проект whisper-diarization
Обзор продвинутого пайплайна для распознавания речи и разделения спикеров. Узнайте, как объединить OpenAI Whisper, Nvidia NeMo и Demucs для создания т...
Как сделать стримы доступнее и круче с помощью Curses
Обзор Curses — мощного опенсорсного инструмента для создания стильных субтитров в реальном времени для OBS, VRChat и Twitch с поддержкой Speech-to-Tex...
MLX-Audio — Когда ваш Mac на Apple Silicon заговорит и услышит
MLX-Audio – это мощная библиотека для Text-to-Speech (TTS), Speech-to-Text (STT) и Speech-to-Speech (STS), оптимизированная для Apple Silicon. Она поз...
Faster Whisper — Когда скорость решает все в работе с речью
Устали ждать, пока OpenAI Whisper обработает ваши аудио? Faster Whisper — это то, что вам нужно: до 4 раз быстрее, экономнее и с теми же впечатляющими...
Dragonfire — Оживите свой Linux! Обзор голосового ассистента, который умеет учиться
Dragonfire — это открытый виртуальный ассистент для Ubuntu-подобных Linux-дистрибутивов. Он позволяет управлять системой голосом, запоминать факты, от...
FunASR: Когда распознавание речи становится не только точным, но и увлекательным
Мечтаете о точном и быстром распознавании речи? FunASR — это мощный, но простой в использовании инструментарий для ASR, VAD, пунктуации и многого друг...
Ускоряем Deep Learning почему NVIDIA Deep Learning Examples — ваш новый лучший друг
Мечтаете о быстрой и точной реализации моделей глубокого обучения? NVIDIA Deep Learning Examples — это готовые рецепты для SOTA-моделей на GPU, от ком...
Rhasspy: приватный голосовой помощник для умного дома
Rhasspy — полностью оффлайн голосовой помощник с открытым исходным кодом, который идеально подходит для интеграции с системами умного дома без утечек...
Echogarden — швейцарский нож для работы с голосом
Echogarden — мощный инструмент для работы с голосом: синтез, распознавание, перевод и обработка речи прямо из командной строки или Node.js приложений
Ирина - ваш личный русскоязычный ассистент без зависимости от интернета
Ирина — русскоязычный голосовой ассистент с открытым исходным кодом, работающий оффлайн. Узнайте, как он устроен и почему стоит попробовать его в 2024...
Vosk - оффлайн-распознавание речи без компромиссов
Vosk — это оффлайн-библиотека для распознавания речи с поддержкой 20+ языков, которая работает даже на Raspberry Pi. Узнайте, как добавить голосовой и...
Chaplin — ваш цифровой чтец по губам
Chaplin — инструмент для чтения по губам, который превращает беззвучную речь в текст в реальном времени. Работает локально, без облачных сервисов.
NotelyVoice Заметки с голосовым вводом, которые уважают вашу конфиденциальность
NotelyVoice — полностью приватное кроссплатформенное приложение для заметок с мощной технологией преобразования речи в текст на основе Whisper AI. Раб...
Voice-Pro - Фабрика голосов в вашем компьютере
Voice-Pro — мощный инструмент для работы с голосом: конвертация, клонирование и мультиязычный перевод в одном решении. Идеально для подкастеров, разра...
WhisperX - Точная расшифровка аудио с временными метками и распознаванием говорящих
WhisperX — мощное расширение для OpenAI Whisper, которое добавляет точные временные метки на уровне слов и идентификацию говорящих. Идеально для транс...