#multimodal
Проекты, в которых ИИ понимает не только текст, но и изображения, голос и видео. Узнайте, как мультимодальные модели и AI-агенты помогают управлять компьютером, автоматизировать задачи и создавать умные приложения. Все свежие open-source инструменты и платформы в одном месте.
Как научить текстовый DeepSeek видеть скриншоты без смены модели
Обзор ModLens: плагин для DeepSeek и терминальных агентов, который добавляет текстовым LLM распознавание картинок через внешний OCR и цепочки API.
Как поднять быстрый инференс для голосовых и мультимодальных моделей с SGLang-Omni
Разбираем SGLang-Omni — специализированный runtime для быстрого многостадийного инференса omni-, TTS- и ASR-моделей с поддержкой OpenAI API.
Как превратить старый Android в умную систему видеонаблюдения с AI-анализом
Превращаем старый Android-смартфон в локальную камеру видеонаблюдения с детекцией движения и AI-анализом через VLM.
Как обучать тяжелые мультимодальные модели без зоопарка скриптов
Разбираем lmms-engine — гибкий движок для распределенного обучения и файнтюнинга тяжелых мультимодальных моделей (VLMs, MoE, Video Diffusion) на FSDP2...
Как научить Claude Code смотреть видео и понимать происходящее на экране
Плагин claude-video-vision превращает Claude Code в инструмент для работы с видео. Он нарезает кадры через ffmpeg, расшифровывает звук через Whisper и...
Как Google пытается навести порядок в разработке AI-приложений с помощью Genkit
Разработчики из команды Firebase выложили в оупенсорс Genkit — фреймворк для сборки AI-фич. Разбираемся, помогает ли он объединить Gemini, OpenAI и Ol...
Как собрать работающего ИИ-агента и не сойти с ума
Обзор книги и репозитория ai-agent-book — глубокого руководства по проектированию AI-агентов с примерами кода, от инструментов до систем самоэволюции.
Как запустить мультимодальный ИИ на своем ноутбуке без облаков и лишних трат
Обзор Parlor — опенсорсного проекта для запуска мультимодального ИИ (зрение + голос) локально на вашем компьютере. Разбираем архитектуру на базе Gemma...
Голоса будущего из одного репозитория - как работает семейство моделей MOSS-TTS
Обзор семейства моделей MOSS-TTS: от клонирования голоса и генерации звуковых эффектов до сверхбыстрого синтеза речи на CPU. Разбираемся, как запустит...
Как поднять свой сервис решения капчи и перестать платить внешним API
Обзор ohmycaptcha — self-hosted сервиса для автоматического решения капчи. Узнайте, как запустить свой аналог YesCaptcha с помощью FastAPI, Playwright...
Как перестать выпрашивать данные у продакшена и начать жить
Обзор NeMo Data Designer от NVIDIA — фреймворка для генерации качественных синтетических данных с помощью LLM и статистических методов.
Как я перестал записывать задачи и доверил свою память Screenpipe
Обзор Screenpipe — open-source инструмента на Rust, который записывает всё, что вы делаете на компьютере, и позволяет искать по этой истории с помощью...
Как заставить смартфон работать вместо вас с помощью Mobile-Agent
Обзор Mobile-Agent от Alibaba — мощной системы ИИ-агентов, которые умеют управлять смартфонами и компьютерами, понимая интерфейс через зрение и выполн...
MLX-Audio — Когда ваш Mac на Apple Silicon заговорит и услышит
MLX-Audio – это мощная библиотека для Text-to-Speech (TTS), Speech-to-Text (STT) и Speech-to-Speech (STS), оптимизированная для Apple Silicon. Она поз...
UltraRAG: Ваш билет в мир RAG-систем без лишнего кода и головной боли
UltraRAG — это фреймворк для быстрой разработки RAG-систем, который позволяет создавать сложные пайплайны с минимальным кодом, визуальным интерфейсом...
SWIFT — Когда тонкая настройка больших моделей становится быстрой и легкой
Устали от боли при тонкой настройке огромных языковых и мультимодальных моделей? SWIFT от ModelScope — это ваш билет в мир эффективного обучения, инфе...
All-in-RAG - Погружение в мир умных ассистентов и расширенного поиска
Погрузитесь в мир Retrieval Augmented Generation (RAG) с проектом All-in-RAG! Это полноценный курс от Datawhale China, который проведет вас от основ д...
ИИ прямо в вашем кармане: RunAnywhere SDKs для мобильных приложений
Узнайте, как RunAnywhere SDKs позволяют встраивать мощные ИИ-модели прямо в мобильные приложения для iOS, Android, React Native и Flutter, обеспечивая...
vLLM-Omni - Мультимодальные модели на скорости света
Представьте, что вы можете быстро и легко развернуть любую мультимодальную модель, от текста до видео. vLLM-Omni делает это реальностью, предлагая выс...
Rerun — Увидеть невидимое — как отлаживать роботов и AI с помощью мультимодальной визуализации
Устали отлаживать роботов или AI, разбираясь в тоннах логов? Rerun — это SDK для логирования и визуализации мультимодальных данных (2D, 3D, текст, сен...
LLaVA - Когда ИИ начинает видеть мир
LLaVA: Открой глаза своему ИИ! Этот проект позволяет языковым моделям «видеть» и понимать изображения, превращая их в мощных мультимодальных ассистент...
Apache SeaTunnel - Ваш надежный мост в мире данных
Apache SeaTunnel – высокопроизводительный инструмент для интеграции данных, способный синхронизировать огромные объемы информации из сотен источников,...