OCRmyPDF: Как превратить сканы в умные PDF за пару команд

22 Jun, 2026
33,962
🔱 2,343
👥 189

Знакома ситуация, когда нужно найти фразу в сотнях отсканированных страниц, а поиск ничего не находит? Или скопировать текст из PDF, а получается лишь кривая каша из символов? Встречайте OCRmyPDF — инструмент, который решает эти проблемы раз и навсегда.

Что это за зверь?

OCRmyPDF — это консольная утилита на Python, которая добавляет OCR (оптическое распознавание символов) слой к PDF-файлам. По сути, она делает "плоские" сканированные документы полноценными цифровыми текстами, сохраняя при этом оригинальное форматирование.

Логотип OCRmyPDF

Проект появился в 2013 году, когда автор не смог найти достойного решения с поддержкой многоязычных документов и корректным размещением текста. Сейчас это один из самых популярных инструментов для работы с PDF — более 30 тысяч звезд на GitHub.

Почему разработчикам это интересно?

  • Интеграция в автоматизированные процессы: можно добавлять в CI/CD пайплайны для обработки документов
  • Поддержка 100+ языков: от английского до китайского
  • Оптимизация размера файлов: часто выходной PDF даже меньше исходного
  • Мультиплатформенность: работает на Linux, Windows, macOS и даже FreeBSD

5 главных возможностей, которые вас удивят

  1. Точное расположение текста В отличие от многих аналогов, OCRmyPDF размещает распознанный текст точно под изображением, делая копирование удобным и предсказуемым.

    Реклама
  2. Поддержка PDF/A Формат PDF/A специально создан для долговременного хранения документов. OCRmyPDF умеет конвертировать в него автоматически.

  3. Исправление дефектов сканирования Кривые страницы? Проблема решается одной опцией:

    ocrmypdf --deskew input.pdf output.pdf
    
  4. Многоязычное распознавание Легко обрабатываем двуязычные документы:

    ocrmypdf -l eng+fra bilingual.pdf bilingual_ocr.pdf
    
  5. Параллельная обработка Утилита автоматически использует все доступные ядра процессора для ускорения работы.

Как это работает под капотом?

OCRmyPDF — это своеобразный "оркестратор", который координирует работу нескольких специализированных инструментов:

  • Tesseract OCR — движок распознавания текста
  • Ghostscript — обработка PDF
  • Unpaper (опционально) — очистка изображений

Весь процесс происходит в несколько этапов:

  1. Анализ входного PDF
  2. Предварительная обработка изображений (если нужно)
  3. Распознавание текста
  4. Создание нового PDF с текстовым слоем
  5. Валидация результата

Демонстрация работы OCRmyPDF

Где это можно применить на практике?

  1. Оцифровка архивов Автоматическая обработка сканов исторических документов с сохранением в PDF/A.

  2. Юридические документы Быстрый поиск по договорам и судебным решениям.

  3. Библиотеки и исследования Работа с отсканированными книгами и статьями.

  4. Автоматизация бизнес-процессов Интеграция в системы электронного документооборота.

Как начать использовать?

Установка проста практически на любой платформе:

# Debian/Ubuntu
sudo apt install ocrmypdf

# macOS
brew install ocrmypdf

# Windows (через WSL)
wsl --install
wsl
sudo apt update && sudo apt install ocrmypdf

Для работы потребуются Tesseract OCR и Ghostscript — их нужно установить отдельно.

Вывод: стоит ли пробовать?

OCRmyPDF — это:

✅ Простота использования (одна команда для базового сценария) ✅ Гибкость (десятки параметров для тонкой настройки) ✅ Надежность (протестировано на миллионах документов) ✅ Активное сообщество (регулярные обновления)

Особенно рекомендую обратить внимание, если вы:

  • Работаете с большими архивами сканов
  • Разрабатываете системы документооборота
  • Часто имеете дело с многоязычными PDF
  • Цените open-source решения

Попробуйте на своих документах — возможно, вы удивитесь, насколько это удобнее ручного распознавания!

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.