Как научить Claude смотреть видео и разбирать их по кадрам
Если скинуть ссылку на YouTube в чат с большой языковой моделью, результат обычно предсказуем. Модель либо прочитает текстовое описание под роликом, либо вытащит автоматические субтитры. При этом весь визуальный ряд останется за кадром. Если в видео показывали код в терминале, интерфейс программы, графики или схему архитектуры, нейросеть об этом даже не узнает.
Разработчик с ником taoufik123-collab выложил репозиторий claude-watch. Это плагин для Claude Code, веб-версии claude.ai и Codex, который дает модели глаза и уши.
Вы передаете команду /watch, прикрепляете ссылку или локальный файл, и Claude действительно смотрит запись перед тем, как ответить на вопрос.
Что происходит под капотом
Скармливать длинное видео мультимодальной модели напрямую в лоб слишком накладно. Если нарезать получасовой ролик на скриншоты каждую секунду, контекстное окно забьется за пару запросов, а счет за токены неприятно удивит.
Автор проекта решил эту задачу через связку из нескольких утилит.
/watch https://youtu.be/iYG5tiFfK3E how does this creator hook the viewer in the first 45 seconds?
Когда вы отправляете запрос, скрипт выполняет четкую цепочку шагов:
- Загружает видео через
yt-dlpво временный каталог. Если вы передали локальный файл вроде.mp4или.mov, утилита работает с ним на месте без лишних копирований. - Достает субтитры. Сначала скрипт ищет встроенные дорожки на платформе, потому что это бесплатно и занимает доли секунды. Если субтитров нет, аудио конвертируется в моно 16 кГц и улетает на транскрибацию в Whisper.
- Нарезает кадры через
ffmpeg. Здесь используется умный фильтр смены сценselect=gt(scene,...), а не банальный таймер раз в пару секунд. Скриншот сохраняется только в момент реальной монтажной склейки. - Отправляет картинки и текст с таймкодами в Claude. Модель считывает изображения параллельно и сопоставляет происходящее на экране с речью спикера.
Расход токенов остается умеренным, потому что число кадров зависит от количества монтажных склеек, а не от длины видео.
Отдельный микроскоп для первых десяти секунд
В проекте есть любопытная деталь под названием hook microscope. В большинстве видео именно вступление определяет, досмотрит зритель материал или закроет вкладку. Скрипт обрабатывает первые 10 секунд с повышенной плотностью в 2 кадра в секунду и накладывает пословную расшифровку Whisper.
В отчете видно, какая картинка находилась перед глазами зрителя в момент произнесения каждого конкретного слова. Это выручает, когда нужно разобрать чужие рекламные креативы, питчи продуктов или вирусные ролики.
Для остальной части видео бюджет скриншотов рассчитывается автоматически:
- До 30 секунд: около 30 кадров
- От 30 секунд до 1 минуты: около 40 кадров
- От 1 до 3 минут: около 60 кадров
- От 3 до 10 минут: около 80 кадров
Если хронометраж превышает 10 минут, скрипт сделает редкую выборку из 100 кадров и покажет предупреждение о том, что анализ получился поверхностным. В таких случаях лучше ограничить отрезок флагами --start и --end.
/watch https://youtu.be/abc --start 2:15 --end 2:45
/watch screen-recording.mp4 --start 50 --end 60
/watch "$URL" --start 1:12:00
Для чего это пригодится на практике
Утилита полезна далеко не только для пересказа роликов с YouTube. Вот четыре рабочих сценария, где связка кадров и таймкодов экономит массу времени.
Диагностика багов по скринкастам. Коллега или пользователь присылает короткую запись экрана с ошибкой. Вместо того чтобы пересматривать видео по кругу и ставить на паузу в нужный момент, вы скармливаете файл команде /watch bug-repro.mov what's going wrong?. Claude находит кадр с дефектом, считывает текст ошибки из интерфейса и описывает причину сбоя.
Чтение кода и слайдов в докладах. Спикер на митапе может рассуждать абстрактно, пока на слайде показан конкретный кусок конфигурационного файла или схема базы данных. Передав флаг --resolution 1024, вы увеличиваете ширину картинок, после чего модель разбирает мелкий шрифт в терминале.
Анализ подачи контента. Маркетологи и авторы каналов могут исследовать структуру успешных видео: как выстроен хук, когда появляются текстовые плашки и как визуальный ряд синхронизирован с голосом.
Автоматическая база знаний в Obsidian. Скрипт формирует структурированный файл report.md со специальными маркерами, которые Claude последовательно заполняет фактами. Если указать путь к хранилищу через переменную $WATCH_VAULT_DIR, отчет сохранится в Obsidian и сразу откроется по ссылке.
Как установить и настроить
Запустить проект можно несколькими путями в зависимости от вашего рабочего окружения.
Самый быстрый вариант для Claude Code:
/plugin marketplace add taoufik123-collab/claude-watch
/plugin install watch@claude-watch
Если вы предпочитаете веб-интерфейс claude.ai, скачайте архив watch.skill со страницы последних релизов в репозитории и добавьте его в Settings -> Capabilities -> Skills. Только не забудьте включить там пункт Code execution, без него запуск системных утилит не сработает.
Для пользователей Codex установка сводится к клонированию репозитория:
git clone https://github.com/taoufik123-collab/claude-watch.git ~/.codex/skills/watch
При первом вызове /watch запустится скрипт самодиагностики. На macOS он автоматически подтянет ffmpeg и yt-dlp через brew, а на Linux и Windows подскажет точные команды для установки пакетов.
Для работы с роликами без встроенных субтитров пригодится API-ключ Groq или OpenAI. Разработчик рекомендует Groq из-за быстрого отклика модели whisper-large-v3 и низких тарифов. Ключи сохраняются в файл ~/.config/watch/.env. Если тратить деньги на распознавание звука не хочется, флаг --no-whisper отключит аудиодорожку и оставит только нарезку кадров.
Ограничения и выводы
Чудес ждать не стоит, у проекта есть понятные границы. Он не умеет логиниться на закрытых платформах, так что видео под замком или корпоративные стримы обработать не выйдет. На длинных записях свыше 10 минут точность падает из-за жесткого лимита в 100 кадров, поэтому лекции и подкасты разумнее скармливать частями.
Проект отлично закрывает слепую зону языковых моделей при работе с видео. Если вы часто разбираете баг-репорты в виде скринкастов или собираете конспекты технических докладов, плагин определенно стоит положить в свой инструментарий.

