Когда документы перестают быть картинками — как Dolphin делает текст, таблицы и формулы машиночитаемыми
Знакома ли вам ситуация, когда нужно извлечь данные из сканированного договора, научной статьи или финансового отчёта? Традиционные OCR-решения часто спотыкаются на сложных макетах, теряют структуру таблиц или не распознают формулы. Команда ByteDance представила Dolphin — модель, которая не просто распознаёт текст, а понимает структуру документа целиком.
Что скрывает ваш PDF?
Dolphin — это мультимодальная модель для анализа документов, которая сочетает:
- Детектирование всех элементов страницы (текст, таблицы, формулы, изображения)
- Сохранение естественного порядка чтения
- Параллельную обработку разных типов контента
Проще говоря, загружаете сканированный договор — получаете Markdown со структурой заголовков, извлечёнными таблицами в CSV и формулами в LaTeX.
5 причин попробовать Dolphin прямо сейчас
- Работает с реальными документами — распознаёт даже сложные научные статьи с формулами и многоколоночными макетами
- Поддержка PDF и изображений — не нужно предварительно конвертировать файлы
- Два режима работы:
- Анализ всей страницы (генерирует JSON и Markdown)
- Обработка отдельных элементов (например, только таблиц)
- Гибкость интеграции — доступны модели в оригинальном формате и через Hugging Face
- Ускоренное выполнение — поддерживает TensorRT-LLM и vLLM для промышленных нагрузок
Как это работает технически?
Архитектура Dolphin следует принципу «проанализировать, затем разобрать»:
-
Фаза анализа:
- Модель сканирует документ и определяет все элементы
- Строит последовательность в порядке чтения (слева направо, сверху вниз)
-
Фаза разбора:
- Разные типы контента обрабатываются параллельно
- Для каждого элемента (текст, таблица, формула) применяется специализированный «якорь»
Кому это нужно на практике?
- Юридические компании — автоматическое извлечение условий из сканированных договоров
- Финансовые аналитики — преобразование отчётов в структурированные данные для Excel
- Научные работники — оцифровка архивных статей с сохранением формул
- Разработчики SaaS — интеграция в системы документооборота
Как начать использовать?
Быстрый старт занимает 3 шага:
git clone https://github.com/ByteDance/Dolphin.git
cd Dolphin
pip install -r requirements.txt
Пример обработки документа:
python demo_page.py --config ./config/Dolphin.yaml --input_path contract.pdf
Или через Hugging Face:
python demo_page_hf.py --model_path ./hf_model --input_path research_paper.png
Что в планах разработчиков?
Команда активно дорабатывает проект:
- В июле 2025 выпустили Fox-Page Benchmark для тестирования
- Добавили поддержку многостраничных PDF
- Оптимизировали скорость работы через TensorRT-LLM
Судя по активности в репозитории (65 открытых issue), проект живёт и развивается. Разработчики даже просят пользователей присылать «провальные» случаи для улучшения модели.
Вывод: стоит ли пробовать?
Dolphin — не панацея, но серьёзный шаг вперёд в анализе документов. Особенно стоит обратить внимание, если:
- Работаете с большим объёмом сканированных документов
- Нужно извлекать не только текст, но и структуру
- Хотите современное решение с поддержкой Hugging Face
Проект открыт под MIT-лицензией, имеет подробную документацию и уже собрал 6400+ звёзд на GitHub — явный признак того, что сообщество увидело в нём ценность.
Попробовать демо-версию можно на официальном сайте.
