Когда документы перестают быть картинками — как Dolphin делает текст, таблицы и формулы машиночитаемыми

25 Mar, 2026
9,025
🔱 769
👥 69

Знакома ли вам ситуация, когда нужно извлечь данные из сканированного договора, научной статьи или финансового отчёта? Традиционные OCR-решения часто спотыкаются на сложных макетах, теряют структуру таблиц или не распознают формулы. Команда ByteDance представила Dolphin — модель, которая не просто распознаёт текст, а понимает структуру документа целиком.

Что скрывает ваш PDF?

Dolphin — это мультимодальная модель для анализа документов, которая сочетает:

  • Детектирование всех элементов страницы (текст, таблицы, формулы, изображения)
  • Сохранение естественного порядка чтения
  • Параллельную обработку разных типов контента

Проще говоря, загружаете сканированный договор — получаете Markdown со структурой заголовков, извлечёнными таблицами в CSV и формулами в LaTeX.

5 причин попробовать Dolphin прямо сейчас

  1. Работает с реальными документами — распознаёт даже сложные научные статьи с формулами и многоколоночными макетами
  2. Поддержка PDF и изображений — не нужно предварительно конвертировать файлы
  3. Два режима работы:
    • Анализ всей страницы (генерирует JSON и Markdown)
    • Обработка отдельных элементов (например, только таблиц)
  4. Гибкость интеграции — доступны модели в оригинальном формате и через Hugging Face
  5. Ускоренное выполнение — поддерживает TensorRT-LLM и vLLM для промышленных нагрузок

Как это работает технически?

Архитектура Dolphin следует принципу «проанализировать, затем разобрать»:

  1. Фаза анализа:

    Реклама
    • Модель сканирует документ и определяет все элементы
    • Строит последовательность в порядке чтения (слева направо, сверху вниз)
  2. Фаза разбора:

    • Разные типы контента обрабатываются параллельно
    • Для каждого элемента (текст, таблица, формула) применяется специализированный «якорь»

Кому это нужно на практике?

  • Юридические компании — автоматическое извлечение условий из сканированных договоров
  • Финансовые аналитики — преобразование отчётов в структурированные данные для Excel
  • Научные работники — оцифровка архивных статей с сохранением формул
  • Разработчики SaaS — интеграция в системы документооборота

Как начать использовать?

Быстрый старт занимает 3 шага:

git clone https://github.com/ByteDance/Dolphin.git
cd Dolphin
pip install -r requirements.txt

Пример обработки документа:

python demo_page.py --config ./config/Dolphin.yaml --input_path contract.pdf

Или через Hugging Face:

python demo_page_hf.py --model_path ./hf_model --input_path research_paper.png

Что в планах разработчиков?

Команда активно дорабатывает проект:

  • В июле 2025 выпустили Fox-Page Benchmark для тестирования
  • Добавили поддержку многостраничных PDF
  • Оптимизировали скорость работы через TensorRT-LLM

Судя по активности в репозитории (65 открытых issue), проект живёт и развивается. Разработчики даже просят пользователей присылать «провальные» случаи для улучшения модели.

Вывод: стоит ли пробовать?

Dolphin — не панацея, но серьёзный шаг вперёд в анализе документов. Особенно стоит обратить внимание, если:

  • Работаете с большим объёмом сканированных документов
  • Нужно извлекать не только текст, но и структуру
  • Хотите современное решение с поддержкой Hugging Face

Проект открыт под MIT-лицензией, имеет подробную документацию и уже собрал 6400+ звёзд на GitHub — явный признак того, что сообщество увидело в нём ценность.

Попробовать демо-версию можно на официальном сайте.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.