T-Rex2 — Когда компьютерное зрение становится по-настоящему гибким
Репозиторий давно не обновлялся
Последнее обновление было 8 месяцев назад.
Представьте: вам нужно научить нейросеть находить на изображениях редкие виды тропических бабочек. Традиционные модели потребуют тысячи размеченных примеров и недель тренировки. А что если можно просто показать системе несколько фотографий и сказать "ищи вот это"? Именно так работает T-Rex2 — новый подход к обнаружению объектов от команды IDEA Research.
Почему это важно?
Традиционные модели компьютерного зрения работают по принципу "закрытого набора" — они умеют находить только те объекты, на которых были обучены. Добавить новый класс — значит заново собирать датасет и переобучать модель. T-Rex2 ломает эту парадигму, предлагая:
- Обнаружение объектов по текстовым описаниям ("найди красную машину")
- Визуальные подсказки (обведи объект на изображении)
- Комбинацию обоих подходов

Ключевые возможности
-
Интерактивное обнаружение
- Рисуете рамку или точку на изображении — модель находит все похожие объекты
- Идеально для быстрого анализа без предварительного обучения
-
Перенос знаний между изображениями
- Показываете пример объекта на одной картинке — находите его на других
- Работает даже с уникальными предметами, которых нет в стандартных датасетах
-
Текстовые запросы
- Описываете объект словами — получаете результат
- Поддерживает сложные запросы вроде "синяя машина с открытым багажником"
Как это работает на практике?
-
Онлайн-демо Самый простой способ попробовать — интерактивная демо-версия. Загружаете изображение, отмечаете объекты и сразу видите результат.
-
API для разработчиков Команда предоставляет бесплатный API для исследователей и студентов. Вот как выглядит базовый пример использования:
python demo_examples/interactive_inference.py --token <your_token>
- Готовые приложения
На базе T-Rex2 уже созданы полезные инструменты:
- Count Anything — автоматический подсчет объектов на изображениях
- T-Rex Label — продвинутый инструмент разметки данных
Технические особенности
T-Rex2 использует синергию текстовых и визуальных подсказок, что дает несколько преимуществ:
- Нулевое обучение (zero-shot) для новых классов
- Высокая точность даже на нестандартных объектах
- Гибкость в работе с разными типами запросов

Кому будет полезен?
- Исследователи — быстрый прототипинг идей без сбора датасетов
- Разработчики — интеграция продвинутого компьютерного зрения в приложения
- Аналитики — обработка изображений в сельском хозяйстве, медицине, логистике
- Преподаватели — наглядная демонстрация возможностей ИИ
Личный опыт
Попробовав демо-версию, я был впечатлен тем, как легко модель находит объекты по единичным примерам. Особенно полезной оказалась функция подсчета — загружаешь фото полки с товарами, отмечаешь один экземпляр и получаешь точное количество.
Как начать использовать?
- Поэкспериментируйте с онлайн-демо
- Для интеграции запросите API-ключ через официальную форму
- Изучите репозиторий проекта для технических деталей
T-Rex2 — это шаг к действительно гибкому компьютерному зрению, где не нужно заранее определять, что именно искать. Инструмент уже используют более 2000 человек, и его популярность продолжает расти.
Проект опубликован в ECCV 2024 и доступен под лицензией IDEA License 1.0.
