#multi-modal
Погрузитесь в мир мультимодальных нейросетей, способных понимать и генерировать текст, изображения, видео и звук. Изучите проекты и инструменты для создания умных голосовых ассистентов, генерации картинок по описанию и мощных ИИ-агентов. Самые актуальные разработки в одном разделе.
TEN Framework — голосовые ассистенты нового поколения с аватарами и мультимодальностью
TEN Framework — открытая платформа для создания мультимодальных голосовых ассистентов с аватарами и интеграцией с популярными LLM
Data-Juicer — Ваш швейцарский нож для подготовки данных под foundation models
Data-Juicer — мощный инструмент для обработки данных под задачи обучения foundation models (включая мультимедийные). Узнайте, как этот проект от Aliba...
VLMEvalKit — Мастер оценки больших мультимодальных моделей
Представляем VLMEvalKit – незаменимый инструмент для тех, кто работает с большими мультимодальными моделями. Оценивайте сотни LVLM на десятках бенчмар...
AgentScope - Конструктор AI-агентов с полным контролем над процессом
AgentScope — это фреймворк для создания мультиагентных приложений на базе больших языковых моделей с прозрачным контролем над всем процессом работы.
Ваш смартфон теперь видит, слышит и говорит обзор MiniCPM-o 4.5
Обзор MiniCPM-o — открытой мультимодальной модели, которая умеет видеть, слышать и говорить в реальном времени прямо на вашем смартфоне или ноутбуке.