Segment Anything: Как Meta AI научила компьютер «видеть» объекты
Репозиторий давно не обновлялся
Последнее обновление было 1 год назад.
Пришло время, когда компьютер может не просто распознавать объекты на изображении, но и точно очерчивать их границы — даже те, которых он никогда раньше не видел. Команда Meta AI Research представила Segment Anything Model (SAM) — модель, которая меняет правила игры в компьютерном зрении.
Что такое SAM и зачем он нужен?
Представьте, что вы выделяете объект в Photoshop. Теперь представьте, что этот процесс происходит автоматически после одного клика — именно так работает SAM. Это foundation model для сегментации изображений, обученная на 11 миллионах изображений и 1.1 миллиарде масок.
Как разработчик, вы можете использовать SAM для:
- Автоматической разметки данных для обучения других моделей
- Создания интерактивных инструментов редактирования изображений
- Обработки видео в реальном времени
- Ускорения процессов в медицинской визуализации
5 причин попробовать SAM прямо сейчас
-
Zero-shot производительность SAM показывает отличные результаты даже на задачах, которых не было в обучающей выборке. Проверено на 23 датасетах!
-
Гибкость использования Работает как с ручными промптами (точки, рамки), так и в полностью автоматическом режиме:
# Ручной режим masks, _, _ = predictor.predict(point_coords=[[x, y]]) # Автоматический режим masks = mask_generator.generate(your_image) -
Три варианта модели Доступны модели разного размера (ViT-H, ViT-L, ViT-B) с чекпоинтами от 335МБ до 2.4ГБ.
-
Поддержка ONNX Модель можно экспортировать для использования в браузере или мобильных приложениях:
python scripts/export_onnx_model.py --checkpoint sam_vit_h_4b8939.pth -
Колоссальный датасет SA-1B — крупнейший в мире датасет для сегментации с лицензией для исследователей.
Как это работает под капотом?
SAM использует transformer-архитектуру с image encoder и prompt-guided mask decoder. Модель обучалась с помощью «data engine» — интерактивного процесса, где:
- Модель делала предсказания
- Анотаторы исправляли ошибки
- Модель дообучалась на новых данных

Практические кейсы
-
Медицинская диагностика Разметка опухолей на МРТ с одного клика вместо часов ручной работы.
-
Электронная коммерция Автоматическое удаление фона у тысяч товарных изображений.
-
Автономные транспортные средства Быстрая сегментация дорожных объектов для систем компьютерного зрения.
-
AR/VR Интерактивное выделение объектов в реальном времени для смешанной реальности.
Как начать использовать?
Установка занимает буквально пару команд:
pip install git+https://github.com/facebookresearch/segment-anything.git
pip install opencv-python pycocotools matplotlib onnxruntime onnx
Затем скачиваете чекпоинт и пробуете на своих изображениях. В репозитории есть отличные примеры ноутбуков для быстрого старта.
Вывод: кому стоит обратить внимание?
Segment Anything — это must-have инструмент для:
- Разработчиков компьютерного зрения
- Исследователей в области ML
- Специалистов по обработке изображений
- Команд, работающих с AR/VR
Проект активно развивается — недавно вышла SAM 2 с поддержкой видео. Самое время присоединиться и попробовать силу foundation models на практике!
PS: Если хотите увидеть SAM в действии, загляните в онлайн-демо — впечатляет!
