Как OpenVINO превращает Audacity в умный аудиоредактор
Знакомы с Audacity? Этот бесплатный аудиоредактор давно стал рабочим инструментом для подкастеров, музыкантов и звукорежиссеров. Но что если добавить к нему искусственный интеллект? Именно это и сделали инженеры Intel, выпустив OpenVINO™ AI Plugins for Audacity.
Что это за проект?
Это набор плагинов, которые добавляют в Audacity функции на базе AI. Причем все вычисления происходят локально на вашем компьютере — никаких облачных сервисов и утечек данных. Под капотом работает OpenVINO — фреймворк Intel для ускорения нейросетей на CPU, GPU и NPU.
Кому это нужно? Практически всем, кто работает со звуком:
- Подкастерам для очистки записей от шумов
- Музыкантам для разделения треков на инструменты
- Видеоблогерам для автоматической транскрибации
- Саунд-дизайнерам для генерации музыкальных фрагментов
Топ-5 фишек, которые вас удивят
1. Разделение музыки на компоненты
Загружаете трек — получаете отдельные дорожки для вокала, баса, ударных и других инструментов. Основано на модели Demucs v4 от Meta. Идеально для ремиксов или караоке.
2. Умное шумоподавление
Два алгоритма на выбор:
- DenseUNet (из Open Model Zoo)
- DeepFilterNet (более продвинутый вариант) Убирает фоновые шумы, сохраняя чистоту голоса. Незаменимо для записи подкастов в домашних условиях.
3. Генерация музыки
Встроена модель MusicGen от Meta. Можно:
- Сгенерировать музыку по текстовому описанию
- Продолжить существующий фрагмент Есть версии для моно и стерео.
4. Транскрибация голоса
Использует whisper.cpp с бэкендом OpenVINO. Переводит речь в текст с высокой точностью, поддерживает перевод на другие языки.
5. Апскейлинг аудио
Улучшает качество старых записей, добавляя детализацию и четкость. Основано на AudioSR — модели для суперразрешения звука.
Технические особенности
Весь код написан на C++ для максимальной производительности. Модели конвертированы из PyTorch в формат OpenVINO IR. Поддерживаются все современные ускорители Intel:
- CPU (с оптимизацией для AVX-512)
- Встроенные GPU
- NPU в новых процессорах
Проект активно развивается — уже портированы модели от Meta, OpenAI и другие open-source решения.
Как начать использовать?
Для Windows есть готовые установочные пакеты. Linux-пользователям придется собрать из исходников, но процесс хорошо документирован.
Кому особенно пригодится?
- Разработчикам, интересующимся применением AI для обработки звука
- Музыкантам и звукорежиссерам
- Создателям подкастов и видеоконтента
- Всем, кто хочет поэкспериментировать с генеративным AI локально
Проект полностью open-source под лицензией GPL v3, так что можно свободно модифицировать и улучшать. Intel явно сделал интересный ход, добавив AI в такой популярный инструмент как Audacity.
