Segment Anything: Как Meta AI научила компьютер «видеть» объекты

19 июл 2025

Репозиторий давно не обновлялся

Последнее обновление было 1 год назад.

54,743
6,350
334
1 год

Пришло время, когда компьютер может не просто распознавать объекты на изображении, но и точно очерчивать их границы — даже те, которых он никогда раньше не видел. Команда Meta AI Research представила Segment Anything Model (SAM) — модель, которая меняет правила игры в компьютерном зрении.

Что такое SAM и зачем он нужен?

Представьте, что вы выделяете объект в Photoshop. Теперь представьте, что этот процесс происходит автоматически после одного клика — именно так работает SAM. Это foundation model для сегментации изображений, обученная на 11 миллионах изображений и 1.1 миллиарде масок.

Как разработчик, вы можете использовать SAM для:

  • Автоматической разметки данных для обучения других моделей
  • Создания интерактивных инструментов редактирования изображений
  • Обработки видео в реальном времени
  • Ускорения процессов в медицинской визуализации

5 причин попробовать SAM прямо сейчас

  1. Zero-shot производительность SAM показывает отличные результаты даже на задачах, которых не было в обучающей выборке. Проверено на 23 датасетах!

  2. Гибкость использования Работает как с ручными промптами (точки, рамки), так и в полностью автоматическом режиме:

    Реклама
    # Ручной режим
    masks, _, _ = predictor.predict(point_coords=[[x, y]])
    
    # Автоматический режим
    masks = mask_generator.generate(your_image)
    
  3. Три варианта модели Доступны модели разного размера (ViT-H, ViT-L, ViT-B) с чекпоинтами от 335МБ до 2.4ГБ.

  4. Поддержка ONNX Модель можно экспортировать для использования в браузере или мобильных приложениях:

    python scripts/export_onnx_model.py --checkpoint sam_vit_h_4b8939.pth
    
  5. Колоссальный датасет SA-1B — крупнейший в мире датасет для сегментации с лицензией для исследователей.

Как это работает под капотом?

SAM использует transformer-архитектуру с image encoder и prompt-guided mask decoder. Модель обучалась с помощью «data engine» — интерактивного процесса, где:

  1. Модель делала предсказания
  2. Анотаторы исправляли ошибки
  3. Модель дообучалась на новых данных

SAM architecture

Практические кейсы

  1. Медицинская диагностика Разметка опухолей на МРТ с одного клика вместо часов ручной работы.

  2. Электронная коммерция Автоматическое удаление фона у тысяч товарных изображений.

  3. Автономные транспортные средства Быстрая сегментация дорожных объектов для систем компьютерного зрения.

  4. AR/VR Интерактивное выделение объектов в реальном времени для смешанной реальности.

Как начать использовать?

Установка занимает буквально пару команд:

pip install git+https://github.com/facebookresearch/segment-anything.git
pip install opencv-python pycocotools matplotlib onnxruntime onnx

Затем скачиваете чекпоинт и пробуете на своих изображениях. В репозитории есть отличные примеры ноутбуков для быстрого старта.

Вывод: кому стоит обратить внимание?

Segment Anything — это must-have инструмент для:

  • Разработчиков компьютерного зрения
  • Исследователей в области ML
  • Специалистов по обработке изображений
  • Команд, работающих с AR/VR

Проект активно развивается — недавно вышла SAM 2 с поддержкой видео. Самое время присоединиться и попробовать силу foundation models на практике!

PS: Если хотите увидеть SAM в действии, загляните в онлайн-демо — впечатляет!

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.