#llm-inference
Все о развертывании и практическом применении больших языковых моделей (LLM). Узнайте, как запускать нейросети локально на своем ПК, интегрировать ИИ в базы данных и создавать умные приложения. Лучшие инструменты, фреймворки и руководства по теме LLM-инференса для разработчиков.
GPUStack — когда у вас есть серверы с GPU, но нет времени настраивать vLLM для каждой модели
GPUStack разворачивает и управляет GPU-кластерами для AI-инференса: сам настраивает vLLM и SGLang, подбирает движок под модель и раздаёт OpenAI-совмес...
Как запустить модель на 26 миллиардов параметров в двух гигабайтах памяти на обычном Mac
Как запустить 26B модель Gemma 4 на Mac с 8 ГБ памяти в рамках 2 ГБ RAM. Обзор Swift и Metal рантайма TurboFieldfare с потоковым чтением весов с SSD.
Как поднять любую открытую нейросеть с OpenAI API в одну команду
Разбираем OpenLLM: инструмент от BentoML, который позволяет запустить любую открытую LLM с OpenAI-совместимым API и встроенным UI в одну команду.
Разбираем LitGPT - как дообучать и запускать открытые нейросети без тяжелых фреймворков
Обзор LitGPT от Lightning AI: реализации 20+ LLM на чистом PyTorch без сложных абстракций для дообучения, квантизации и локального деплоя.
Как войти в мир больших языковых моделей и не сойти с ума от обилия технологий
Полное руководство по миру LLM: от обучения и микронастройки (LoRA/QLoRA) до оптимизации инференса (vLLM/TensorRT) и квантования. Практический код и г...
Как приручить дракона и масштабировать LLM до небес
Обзор Scaling Book от инженеров Google DeepMind — практического руководства по масштабированию LLM на TPU с использованием JAX. Разбираемся, как избеж...
Запускаем локальные LLM без мучений и Python
Обзор shimmy — сверхбыстрого и легкого сервера на Rust для запуска локальных LLM с полной поддержкой OpenAI API без зависимостей и Python.
Как запустить LLM на смартфоне и не расплавить его - обзор Cactus Engine
Обзор Cactus — сверхбыстрого и энергоэффективного движка для запуска LLM, Whisper и Vision-моделей прямо на смартфонах и носимых устройствах.
Как запустить Mistral на своем железе без лишней головной боли
Обзор официальной библиотеки mistral-inference: как запускать топовые модели Mistral, Mixtral и Codestral локально, работать с изображениями и использ...
RuVector когда векторная база данных начинает учиться на своих ошибках
Обзор RuVector — самообучающейся векторной базы данных на Rust. Узнайте, как графовые нейросети и когнитивные контейнеры меняют подход к поиску и рабо...
Забудьте про спагетти-код в AI-агентах с помощью Plano
Обзор Plano — AI-native прокси-сервера на Rust, который берет на себя оркестрацию агентов, роутинг LLM и безопасность, позволяя разработчикам сфокусир...
Spice.ai - Ваш новый швейцарский нож для данных и ИИ-приложений
Spice.ai — это движок для SQL-запросов, поиска и LLM-инференса на Rust, который позволяет создавать быстрые, надёжные и управляемые данными приложения...
FlashInfer: Когда LLM летают, а не ползают
FlashInfer – это высокопроизводительная библиотека GPU-ядер для ускорения инференса больших языковых моделей. Решает проблемы производительности, памя...
NVIDIA Generative AI Examples: Ваш ускоритель в мире ИИ
Погрузитесь в мир генеративного ИИ с NVIDIA! Этот репозиторий — ваш проводник по созданию RAG-пайплайнов, агентных систем и тонкой настройке моделей,...
Arch — Дирижер для ваших AI-агентов и LLM в продакшене
Устали от рутины при разработке AI-агентов? ArchGW — это интеллектуальный прокси, который берет на себя всю "сантехнику": умный роутинг LLM, гибкие gu...
KServe как перестать бояться и полюбить деплой ML-моделей в Kubernetes
Устали от хаоса при выкатке ML-моделей? KServe предлагает единый стандарт для развертывания как классических, так и генеративных AI-моделей в Kubernet...
SuperDuperDB — Когда ваша база данных становится умной
SuperDuperDB — это инновационный фреймворк для интеграции AI-моделей прямо в вашу базу данных. Узнайте, как он упрощает создание интеллектуальных прил...
Gitleaks — детектор секретов в вашем коде
Gitleaks — инструмент для поиска случайно закоммиченных секретов в Git-репозиториях. Как он помогает предотвращать утечки API-ключей, токенов и пароле...