Chaplin — ваш цифровой чтец по губам

02 Nov, 2025

Репозиторий давно не обновлялся

Последнее обновление было 8 месяцев назад.

744
🔱 87
👥 11

Chaplin Thumbnail

Представьте: вы работаете в шумном офисе или находитесь в библиотеке, где нельзя говорить вслух. Вместо того чтобы печатать, вы просто шевелите губами — и текст появляется на экране. Звучит как сцена из фантастического фильма? С Chaplin это реальность уже сегодня.

Что это за проект?

Chaplin — это инструмент визуального распознавания речи (Visual Speech Recognition), который:

  • Анализирует движение губ через веб-камеру
  • Преобразует мимику в текст в реальном времени
  • Работает полностью локально — ваши данные никуда не уходят
  • Поддерживает английский язык (с возможностью расширения)

Проект собрал уже 519 звезд на GitHub и активно развивается.

Кому это нужно?

  • Разработчикам, которые хотят поэкспериментировать с компьютерным зрением и NLP
  • Тем, кто работает в шумных или требующих тишины местах
  • Людям с ограниченными возможностями речи
  • Всем, кому интересны современные технологии машинного обучения

Как это работает: технические детали

Под капотом Chaplin использует:

Реклама
  1. Модель Auto-AVSR — обучена на датасете Lip Reading Sentences 3 (LRS3) с точностью WER 19.1%
  2. MediaPipe — для трекинга движения губ
  3. Ollama с Llama3.2 — языковая модель для постобработки текста
  4. UV — ультрабыстрый инсталлятор Python-пакетов

Интересно, что вся обработка происходит на вашем компьютере — никаких облачных API и потенциальных утечек данных.

Как попробовать?

Установка выглядит немного сложной, но мы разбили её на простые шаги:

  1. Клонируем репозиторий:
git clone https://github.com/amanvirparhar/chaplin
cd chaplin
  1. Скачиваем модель распознавания и языковую модель
  2. Устанавливаем Ollama и запускаем:
ollama pull llama3.2
  1. Запускаем Chaplin:
sudo uv run --with-requirements requirements.txt --python 3.12 main.py config_filename=./configs/LRS3_V_WER19.1.ini detector=mediapipe

После запуска:

  • Нажимаем Alt/Option для начала записи
  • Шевелим губами (без звука!)
  • Снова Alt/Option — и текст появляется там, где стоит курсор

Где это можно применить?

  1. Беззвучный ввод — в шумных open-space или ночью, когда нельзя будить домочадцев
  2. Специальные возможности — помощь людям с нарушениями речи
  3. Исследования — эксперименты с multimodal AI (аудио+видео)
  4. Образование — наглядная демонстрация работы компьютерного зрения

Ограничения

  • Пока работает только с английским
  • Требует хорошего освещения лица
  • Нужна веб-камера с четким изображением
  • Модель занимает около 1.5 ГБ на диске

Вывод: стоит ли пробовать?

Chaplin — это тот редкий случай, когда передовая технология доступна каждому. Да, это не коммерческий продукт, а скорее proof-of-concept, но:

✅ Отличный учебный проект для знакомства с VSR ✅ Практическое применение уже сегодня ✅ Полная локальная работа — конфиденциальность данных

Если вы интересуетесь компьютерным зрением или просто хотите попробовать «магию» ИИ на своём компьютере — смело клонируйте репозиторий. А если английский не ваш основной язык — возможно, это отличный повод внести вклад в проект и добавить поддержку других языков!

Демо-видео: YouTube Репозиторий: GitHub

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.