Как превратить голос в код и заметки без облаков и подписок
Я часто ловлю себя на мысли, что печатать длинные идеи или протоколы встреч — это пустая трата времени. Стандартная диктовка в macOS работает с переменным успехом, а популярные сервисы вроде Otter или Whisper в облаке либо стоят как крыло самолета, либо заставляют переживать за приватность данных. Недавно наткнулся на проект Pindrop, который решает эти проблемы довольно элегантно.
Pindrop — это опенсорсное приложение для macOS, которое живет в меню-баре и переводит речь в текст прямо на вашем железе. Никаких запросов к серверам OpenAI, никакой абонентской платы. Только ваш Mac, микрофон и локальные модели Whisper.

Почему это не очередной обертка над Whisper
Когда видишь очередное приложение для транскрипции, первая мысль: «Опять Electron или какой-нибудь тяжелый Python-скрипт». С Pindrop история другая. Автор написал его на чистом Swift и SwiftUI. Для обработки звука используется WhisperKit — это оптимизированная под Core ML реализация модели Whisper от OpenAI.
Что это дает на практике? На чипах Apple Silicon (M1–M4) транскрипция летит. За счет нативной интеграции с нейронным движком (Neural Engine) приложение работает в 2–3 раза быстрее, чем обычные порты Whisper, и при этом почти не ест батарейку. Если вы работаете в кафе без зарядки, это критичный момент.
Что умеет Pindrop
Приложение закрывает сразу несколько сценариев, от быстрой заметки «на бегу» до ведения архива встреч.
Умная вставка текста
Самая полезная фича для разработчика — режим прямой вставки. Вы нажимаете хоткей (по умолчанию Option + Space), наговариваете текст, и после завершения он не просто падает в буфер обмена, а печатается прямо там, где стоит курсор. Это удобно, когда нужно быстро набросать комментарий к коду или ответить в Slack, не отвлекаясь от клавиатуры.
Система заметок и тегов
В отличие от простых утилит-однодневок, здесь есть полноценный дашборд с историей. Каждую транскрипцию можно превратить в заметку, добавить теги или закрепить в топе. Есть даже опциональная фича: если у вас есть API-ключ любого OpenAI-совместимого сервиса, Pindrop может автоматически генерировать заголовки для ваших записей или «причесывать» текст, убирая слова-паразиты.
Кастомный словарь
Если вы постоянно используете специфические термины, названия библиотек или фамилии коллег, которые Whisper упорно коверкает, их можно занести в пользовательский словарь. Это сильно повышает точность, особенно в узкоспециализированных темах.
Выбор моделей под задачу
В настройках можно выбрать размер модели:
- Tiny (~75 МБ) — мгновенная реакция, подходит для простых команд и коротких фраз.
- Base/Small — золотая середина для повседневных задач.
- Large (~3 ГБ) — когда нужна максимальная точность, например, для записи лекций или интервью.
Техническая сторона вопроса
Архитектура проекта выглядит стройно. Автор использует SwiftData для хранения истории и заметок, что логично для современного нативного приложения. Из внешних зависимостей — только сам WhisperKit. Все остальное — это стандартные фреймворки Apple.
Если заглянуть в исходники, видно, что проект модульный. Есть четкое разделение на сервисы: AudioRecorder отвечает за захват звука, TranscriptionService рулит движками (кстати, кроме WhisperKit поддерживается еще и Parakeet), а HotkeyManager следит за глобальными сочетаниями клавиш.
Для тех, кто хочет собрать проект сам, в репозитории есть justfile. С помощью утилиты just можно одной командой собрать билд, прогнать тесты или создать DMG-образ.
Как начать пользоваться
Поскольку разработчик пока не обзавелся платным аккаунтом Apple Developer, приложение распространяется как self-signed build. При первом запуске macOS может ругнуться на «непроверенного разработчика». Лечится это стандартно через «Системные настройки» → «Конфиденциальность и безопасность» → «Открыть все равно».
После запуска вы увидите иконку микрофона в меню-баре. Первым делом приложение предложит скачать модель (советую начать с Tiny или Base) и настроить микрофон.
Кому это пригодится
Pindrop точно зайдет тем, кто:
- Работает на MacBook с Apple Silicon и ценит нативный софт.
- Параноидально относится к приватности и не хочет отправлять записи своих разговоров в облако.
- Часто пишет документацию или письма и хочет делать это голосом, не теряя в скорости.
Проект полностью открытый, и это подкупает. Нет никаких скрытых подписок или «Pro-версий» за пейволлом. Если вам не хватает какой-то специфической фичи, можно просто закинуть Pull Request или обсудить идею в GitHub Discussions.
Конечно, Intel-маки тоже поддерживаются, но там магии Core ML будет меньше, и транскрипция может занимать больше времени. Но для владельцев M-серии это, пожалуй, одно из самых приятных решений для диктовки на сегодняшний день.