#speech-to-text
Изучите проекты для преобразования речи в текст: от мощных офлайн-библиотек для разработчиков до готовых приложений, уважающих вашу приватность. Узнайте все о точной транскрибации аудио, создании голосовых интерфейсов и интеграции речевых технологий в ваши продукты.
MLX-Audio — Когда ваш Mac на Apple Silicon заговорит и услышит
MLX-Audio – это мощная библиотека для Text-to-Speech (TTS), Speech-to-Text (STT) и Speech-to-Speech (STS), оптимизированная для Apple Silicon. Она поз...
Handy - Ваш личный оффлайн-стенографист
Handy — это open-source приложение для преобразования речи в текст, работающее полностью оффлайн. Узнайте, как оно может упростить вашу работу и почем...
Sherpa-Onnx — Швейцарский нож для голосовых технологий без интернета
Sherpa-Onnx — универсальный open-source инструмент для работы с голосом: от распознавания речи до синтеза и анализа. Работает локально на любых устрой...
Все локальные нейросети в одном окне — смотрим Uncensored Local Studio
Разбираем open-source проект Uncensored Local Studio, который объединяет генерацию изображений, текстовую модель, распознавание речи и синтез голоса в...
Голосовые AI-агенты без боли и спагетти-кода
Обзор Rapida — open-source платформы на Go для создания высокопроизводительных голосовых AI-агентов с поддержкой gRPC стриминга, LLM-оркестрации и глу...
Как перевести видео на другой язык и не сойти с ума
Обзор мощного Open Source инструмента pyVideoTrans для автоматического перевода видео, клонирования голоса и генерации субтитров. Разбираемся, как это...
Silero Models мощные инструменты для работы с голосом без головной боли
Silero Models — это коллекция предобученных моделей для распознавания и синтеза речи, которые сочетают в себе качество корпоративного уровня с простот...
Как собрать свой GPT-4o на коленке: обзор Speech-to-Speech от Hugging Face
Разбираем Speech-to-Speech от Hugging Face — модульный Open Source проект для создания голосовых ассистентов уровня GPT-4o. Узнайте, как собрать свой...
Как превратить старый ПК в персональное облако искусственного интеллекта
Обзор Osmantic Deployment System (ODS) — готового решения для развертывания персонального ИИ-сервера с LLM, агентами и автоматизацией на собственном ж...
Как превратить старый ПК в персональный сервер ИИ без боли и CUDA-драйверов
Обзор ODS (Osmantic Deployment System) — инструмента для быстрого развертывания локального ИИ-сервера с LLM, RAG, генерацией изображений и автоматизац...
Echogarden — швейцарский нож для работы с голосом
Echogarden — мощный инструмент для работы с голосом: синтез, распознавание, перевод и обработка речи прямо из командной строки или Node.js приложений
Как распознать речь на 31 языке без Python и GPU
Обзор Fun-ASR: мощной модели распознавания речи с поддержкой 31 языка, оптимизацией для CPU через llama.cpp и высокой скоростью благодаря vLLM.
Как превратить голос в код и заметки без облаков и лишних глаз
Обзор OpenWhispr — опенсорсного инструмента для локальной диктовки, транскрипции встреч и работы с AI-агентами без облаков и подписок.
Как запустить распознавание речи на любом железе без боли и Python-зависимостей
Обзор transcribe.cpp — легковесной C/C++ библиотеки для распознавания речи на базе ggml. Поддержка 16 семейств моделей, включая Whisper и Canary, с ус...
AutoSubs субтитры в один клик без головной боли
AutoSubs — инструмент для мгновенного создания субтитров с помощью AI, который работает локально и интегрируется с DaVinci Resolve. Идеально подходит...
Твой собственный ИИ в одной коробке — пробуем Dream Server
Обзор Dream Server — готового ИИ-стека для локального запуска. LLM, агенты, RAG и генерация изображений в одной коробке с установкой одной командой.
Голосовые ИИ-агенты без привязки к облакам - пробуем Dograh AI
Dograh AI — это open-source альтернатива Vapi и Retell для создания голосовых ИИ-агентов. Рассказываю, как запустить своего бота за 2 минуты и почему...
Забудьте про клавиатуру - как Amical превращает ваш голос в код и заметки прямо на компьютере
Обзор Amical — open-source приложения для AI-диктовки, которое работает полностью локально, понимает контекст ваших программ и помогает разработчикам...
Как превратить голос в код и заметки без облаков и подписок
Обзор Pindrop — нативного опенсорсного приложения для macOS, которое переводит речь в текст локально с помощью WhisperKit и Core ML. Без облаков, подп...
Как добавить голосовое управление на сайт с помощью библиотеки annyang
Обзор крошечной JS-библиотеки annyang, которая позволяет добавить голосовое управление на сайт всего парой строк кода. Разбираемся, как это работает н...
WhisperX - Точная расшифровка аудио с временными метками и распознаванием говорящих
WhisperX — мощное расширение для OpenAI Whisper, которое добавляет точные временные метки на уровне слов и идентификацию говорящих. Идеально для транс...
Voice-Pro - Фабрика голосов в вашем компьютере
Voice-Pro — мощный инструмент для работы с голосом: конвертация, клонирование и мультиязычный перевод в одном решении. Идеально для подкастеров, разра...