LGM — 3D-революция для разработчиков без навыков моделирования
Репозиторий давно не обновлялся
Последнее обновление было 1 год назад.
Представьте: вы описываете объект текстом или загружаете 2D-изображение — и через несколько секунд получаете готовую 3D-модель высокого качества. Звучит как фантастика? Именно это и предлагает Large Multi-View Gaussian Model (LGM), новый open-source проект от команды 3DTopia, который уже получил признание на ECCV 2024.
Кому пригодится LGM?
Эта технология открывает новые возможности для:
- Геймдев-разработчиков, которым нужно быстро прототипировать ассеты
- Дизайнеров, создающих 3D-контент для AR/VR
- Разработчиков образовательных приложений
- Всем, кто работает с 3D, но не хочет тратить часы на ручное моделирование
Ключевые возможности
-
Текст в 3D Просто введите описание, например "реалистичный красный спортивный автомобиль", и LGM сгенерирует трехмерную модель с детализированной геометрией и текстурой.
-
Изображение в 3D Загрузите 2D-фото — система автоматически создаст его 3D-версию, сохраняя все особенности оригинала.
-
Высокое разрешение В отличие от многих аналогов, LGM производит модели с высокой детализацией благодаря использованию гауссовых сплайнов.
-
Гибкий экспорт Результаты можно сохранить в форматах .ply и .glb, что делает их совместимыми с большинством 3D-редакторов и игровых движков.
-
Режим предпросмотра Встроенный GUI позволяет вращать и осматривать модель прямо в процессе генерации.
Как это работает технически?
LGM построена на трех основных компонентах:
-
Гауссовы сплайны - технология, которая представляет 3D-объекты как набор "размытых" точек (гауссоидов), что позволяет добиться плавных переходов и высокой детализации.
-
Мультивьюность - модель анализирует объект с разных ракурсов, что обеспечивает целостность и согласованность 3D-репрезентации.
-
Глубокое обучение - система использует дообученные версии MVDream и ImageDream для понимания текстовых описаний и изображений.
Практическое применение
Вот несколько реальных сценариев использования LGM:
# Генерация 3D-модели по текстовому описанию
python app.py big --resume pretrained/model_fp16.safetensors
# Конвертация изображения в 3D
python infer.py big --resume pretrained/model_fp16.safetensors --workspace output --test_path my_image.jpg
- Быстрое прототипирование - создавайте базовые модели для игр за минуты вместо часов
- Контент для соцсетей - превращайте обычные фото в интерактивные 3D-посты
- Образование - визуализируйте сложные концепции из учебников
- Электронная коммерция - добавляйте 3D-просмотр товаров без дорогостоящей съемки
Начать просто
Установка занимает несколько минут:
pip install torch==2.1.0 torchvision==0.16.0 torchaudio==2.1.0 --index-url https://download.pytorch.org/whl/cu118
pip install -U xformers --index-url https://download.pytorch.org/whl/cu118
git clone --recursive https://github.com/ashawkey/diff-gaussian-rasterization
pip install ./diff-gaussian-rasterization
pip install -r requirements.txt
Для тестирования можно использовать готовые веса с Hugging Face:
mkdir pretrained && cd pretrained
wget https://huggingface.co/ashawkey/LGM/resolve/main/model_fp16_fixrot.safetensors
cd ..
Вывод: стоит ли пробовать?
LGM — это серьезный шаг вперед в democratization 3D-контента. Хотя система еще не идеальна (иногда требует постобработки моделей), она уже сейчас может значительно ускорить рабочий процесс. Особенно рекомендую попробовать:
- Инди-разработчикам с ограниченными ресурсами
- Дизайнерам, которые хотят расширить свои возможности
- Исследователям в области компьютерного зрения
Проект активно развивается — последние изменения (апрель 2024) включают важные исправления в нормализации вращения. Так что сейчас отличный момент, чтобы присоединиться к сообществу пользователей LGM!
Готовы создать свою первую 3D-модель без мучений с Blender? Репозиторий LGM на GitHub ждет вас.
