Rex-Omni: Видеть мир как текст, предсказывать объекты как слова

22 Feb, 2026
1,536
🔱 109
👥 13

Представьте, что вы можете описать любой объект на изображении, и нейросеть не просто его найдет, но и точно укажет его местоположение, выделит контур или даже определит ключевые точки. Звучит как научная фантастика? А что, если я скажу, что теперь это реальность, и за этим стоит концепция, которую мы хорошо знаем в мире больших языковых моделей — предсказание следующего токена?

Знакомьтесь, Rex-Omni — проект от IDEA-Research, который переворачивает наше представление о компьютерном зрении. Это не просто очередная модель для детекции объектов; это 3-миллиардная мультимодальная большая языковая модель (MLLM), которая унифицирует множество задач визуального восприятия, сводя их к одной простой задаче: предсказанию следующего токена. Да-да, именно так, как это делают привычные нам LLM с текстом. По сути, Rex-Omni учится "говорить" о том, что видит, и в этом "разговоре" описывает местоположение объектов.

Rex-Omni Logo

Зачем это нужно разработчику?

В моей практике часто приходится сталкиваться с задачами, где нужно не просто определить наличие объекта, но и точно указать его координаты, выделить текст или найти конкретные элементы интерфейса. Обычно это требует целого зоопарка разных моделей, каждая из которых обучена под свою узкую задачу. Rex-Omni предлагает элегантное решение: одна модель для всего. Это значительно упрощает архитектуру приложений, снижает накладные расходы на управление множеством моделей и, что самое главное, открывает двери для более гибких и контекстно-зависимых систем компьютерного зрения.

Как Rex-Omni "видит" мир?

Сердце Rex-Omni — это идея о том, что визуальные задачи можно представить как последовательности токенов. Модель принимает на вход изображение и текстовый запрос (например, "найди человека" или "выдели текст"), а на выходе генерирует последовательность токенов, которые кодируют координаты ограничивающих рамок, точек или полигонов. Это похоже на то, как LLM отвечает на вопрос, генерируя слова.

Например, чтобы найти человека, вы просто говорите модели: "task: detection, categories: ["man"]", и она возвращает координаты. Это невероятно интуитивно и мощно!

Rex-Omni Teaser

Ключевые возможности: Не просто детекция, а целый арсенал

Rex-Omni далеко не ограничивается простой детекцией. Вот лишь некоторые из впечатляющих задач, которые она может выполнять:

1. Детекция объектов (Detection)

Стандартная, но очень гибкая детекция. Вы можете задать список категорий, и модель найдет их все на изображении. Причем категории могут быть очень специфичными и даже комбинированными, благодаря языковой природе модели.

Object Detection Example

2. Указание объектов (Pointing)

Представьте, что вам нужно не просто выделить объект рамкой, а указать на него конкретной точкой. Rex-Omni умеет и это! Это особенно полезно для задач, где важна высокая точность указания, например, в робототехнике или интерактивных системах.

Object Pointing Example

3. Оптическое распознавание символов (OCR) с геометрией

Rex-Omni может не только распознавать текст, но и предоставлять его местоположение в виде ограничивающих рамок (word box, textline box) или даже сложных полигонов. Это открывает новые возможности для анализа документов, автоматизации ввода данных и создания "умных" помощников.

OCR Word Box Example

4. Детекция ключевых точек (Keypointing)

Нужно отследить позы человека, движения рук или даже части тела животных? Rex-Omni справляется и с этим, предоставляя точные координаты ключевых точек.

Person Keypointing Example

5. Понимание графических интерфейсов (GUI Grounding & Pointing)

Это просто находка для разработчиков, работающих с автоматизацией тестирования UI или созданием интеллектуальных агентов. Модель может находить элементы интерфейса по текстовому описанию и даже указывать на них.

GUI Grounding Example

Под капотом: Производительность и гибкость

Rex-Omni построен на базе Qwen2.5-VL-3B, что уже говорит о его серьезных возможностях. Для развертывания и инференса проект предлагает несколько опций:

  • transformers backend: Простой в использовании, хорошая базовая производительность.
  • vllm backend: Для высокопроизводительного инференса с низкой задержкой, идеально подходит для продакшена, где важна скорость и пропускная способность.

Кстати, разработчики позаботились и об экономии ресурсов, выпустив квантованную версию Rex-Omni (AWQ), которая позволяет сократить объем занимаемой памяти на 50% без существенной потери качества. Это очень важно для тех, кто работает с ограниченными вычислительными ресурсами.

from PIL import Image
from rex_omni import RexOmniWrapper, RexOmniVisualize

# Инициализация модели (можно использовать AWQ версию)
rex = RexOmniWrapper(
    model_path="IDEA-Research/Rex-Omni-AWQ",
    backend="vllm",
    quantization="awq",
    max_tokens=2048,
    temperature=0.0,
)

# Подготовка изображения и категорий
image = Image.open("tutorials/detection_example/test_images/cafe.jpg").convert("RGB")
categories = [
    "man", "woman", "yellow flower", "sofa", "robot-shope light",
    "blanket", "microwave", "laptop", "cup", "white chair", "lamp",
]

# Запуск детекции
results = rex.inference(images=image, task="detection", categories=categories)
result = results[0]

# Визуализация результатов
vis = RexOmniVisualize(
    image=image,
    predictions=result["extracted_predictions"],
    font_size=20,
    draw_width=5,
    show_labels=True,
)
vis.save("tutorials/detection_example/test_images/cafe_visualize.jpg")

Интеграции и реальные сценарии: Больше, чем просто детекция

Унифицированный фреймворк Rex-Omni позволяет легко интегрировать его с другими моделями для создания еще более мощных решений:

Rex-Omni + SAM: Детекция с пиксельной точностью

Представьте, что Rex-Omni находит объект по вашему текстовому запросу, а затем Segment Anything Model (SAM) с пиксельной точностью выделяет его контур. Это идеальное сочетание для задач, требующих как семантического понимания, так и точной сегментации.

Rex-Omni + SAM Integration

Grounding Data Engine: Автоматическая разметка данных

Rex-Omni может автоматически генерировать аннотации для задач phrase grounding из подписей к изображениям. Это значительно ускоряет процесс подготовки данных для обучения других моделей, что является настоящей болью для многих команд.

Grounding Data Engine Example

Попробуй сам: Gradio Demo и Fine-tuning

Разработчики предоставили интерактивное Gradio демо, которое позволяет быстро протестировать все возможности Rex-Omni через веб-интерфейс. Это отличный способ познакомиться с моделью без глубокого погружения в код.

Gradio Demo

Кроме того, доступен код для тонкой настройки (fine-tuning) модели на ваших собственных данных. Это критически важно для адаптации Rex-Omni под специфические нужды вашего проекта и достижения максимальной точности.

Кстати, команда IDEA-Research недавно также представила Resophy — AI-помощника для чтения научных статей. Это не напрямую связано с Rex-Omni, но показывает общий вектор развития команды в сторону интеллектуальных инструментов.

Выводы: Стоит ли Rex-Omni вашего внимания?

Однозначно, да! Rex-Omni — это не просто еще одна модель, а новый взгляд на унификацию задач компьютерного зрения. Если вы работаете с обработкой изображений, создаете интеллектуальных агентов, автоматизируете процессы или просто интересуетесь передовыми разработками в области MLLM, этот проект заслуживает самого пристального внимания.

Его способность выполнять широкий спектр задач, гибкость в развертывании (от transformers до vllm), поддержка квантования и возможность тонкой настройки делают его мощным инструментом в арсенале любого разработчика. Он упрощает архитектуру, снижает порог входа для сложных задач зрения и открывает путь к созданию по-настоящему умных систем, которые "понимают" изображения так же легко, как мы понимаем текст.

Так что, если вы ищете способ сделать ваши приложения умнее и избавиться от зоопарка моделей для каждой задачи компьютерного зрения, Rex-Omni может стать вашим новым лучшим другом. Попробуйте, и, возможно, вы больше никогда не посмотрите на детекцию объектов по-старому!

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.