Как запустить нейросеть на 27 миллиардов параметров на обычном iPhone или домашнем ПК
Недавно я поймал себя на мысли: мы привыкли, что для запуска серьезных LLM (Large Language Models) нужны серверные стойки с A100 или хотя бы топовые RTX 4090. Но что, если я скажу, что модель уровня 27B теперь можно «засунуть» в оперативную память обычного смартфона или ноутбука без дискретной графики? Проект Bonsai-demo от команды PrismML делает именно это, используя магию 1-битного и тернарного квантования.
В чем соль проекта
Основная проблема больших моделей — их «прожорливость». Стандартная 27B модель в 16-битном формате весит около 50 ГБ. Даже популярное 4-битное сжатие (Q4_K_M) требует 16-17 ГБ видеопамяти только под веса. Bonsai-demo предлагает перейти на экстремальный уровень: 1-битные и тернарные (1.58-2 бита) модели.
В итоге Bonsai-27B в 1-битном исполнении занимает всего 3.5 ГБ. Это сопоставимо с размером средней мобильной игры. При этом разработчики заявляют, что модель сохраняет способность рассуждать, видеть изображения и даже вызывать инструменты (tool calling).
Что умеет это «дерево»
Я покопался в репозитории и выделил несколько вещей, которые реально цепляют.
Зрение и работа с документами
Модели серии 27B здесь не просто текстовые. Это мультимодальные системы. Им можно скормить скриншоты, фотографии или PDF-файлы. Внутри используется специальный проектор, который переводит визуальные данные в понятные модели токены. Для локальной системы, работающей на CPU, это выглядит как магия.
Агентские замашки и MCP
В демо встроен полноценный клиент для протокола MCP (Model Context Protocol). Если вы пропустили: это новый стандарт от Anthropic, который позволяет модели подключаться к внешним данным. В Bonsai-demo уже «из коробки» настроены инструменты для работы с DeepWiki и Hugging Face. То есть модель не просто галлюцинирует, а идет в интернет за фактами.
Режим «размышления»
У 27B моделей есть фишка с цепочкой рассуждений (thinking). В интерфейсе можно выставить бюджет на раздумья: от быстрого ответа до глубокого анализа на 8000+ токенов. Если железо слабое, лучше ставить Low, иначе придется долго ждать, пока модель «прокрутит» свои мысли в фоне.
Экстремальная экономия контекста
Обычно контекст в 100 000 токенов съедает гигабайты памяти. Здесь авторы добавили экспериментальную поддержку 4-битного KV-кэша. Это сокращает потребление памяти для длинных диалогов в 3.5 раза. В цифрах: 100к токенов занимают около 1.8 ГБ вместо обычных 6.3 ГБ.
Техническая подноготная
Проект опирается на форк llama.cpp и фреймворк MLX для Apple Silicon. Интересно, что поддержка 1-битного квантования (Q1_0) уже начала вливаться в основной апстрим llama.cpp. С тернарными весами (Q2_0) ситуация чуть сложнее: они сейчас находятся в процессе миграции, поэтому проект тащит свои прекомпилированные бинарники для разных платформ.
Если у вас Mac на M-чипе, скрипт сборки подтянет MLX и соберет все компоненты прямо под вашу архитектуру. Для Windows и Linux предусмотрены скрипты с автоопределением CUDA и Vulkan.
Как это пощупать
Разработчики сделали процесс максимально «бесшовным». Не нужно вручную скачивать веса с Hugging Face или настраивать окружение.
Для macOS или Linux достаточно трех строчек:
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh
Скрипт сам поставит пакетный менеджер uv, создаст виртуальное окружение, скачает нужную модель (по умолчанию Ternary-Bonsai-27B) и подготовит бинарники.
После этого можно запустить локальный сервер:
./scripts/start_llama_server.sh
И зайти в браузере на localhost:8080. Там будет привычный чат, где можно потестировать и зрение, и скорость генерации.
Стоит ли пробовать
Bonsai-demo — это не про «убийцу GPT-4», а про доступность. Если вам нужно запустить умного помощника на офисном ноутбуке без видеокарты или встроить LLM в мобильное приложение, этот проект дает готовую базу.
Конечно, 1-битные модели глупее своих полноразмерных собратьев. Они могут чаще ошибаться в сложных логических задачах. Но для базовой автоматизации, классификации текста или простых чат-ботов с контекстом в 256к токенов — это одно из самых эффективных решений на текущий момент.
Главный плюс репозитория в его «упакованности». Вам не нужно быть специалистом по квантованию, чтобы завести тернарную модель. Все грязные хаки с компиляцией и настройкой параметров уже спрятаны внутри bash-скриптов.
