Как Alibaba учит нейросети думать и кодить на уровне профи — обзор Qwen3.6

03 Jun, 2026
3,710
🔱 253
👥 28

Вы когда-нибудь пробовали заставить LLM разобраться в структуре большого репозитория или поправить баг, который тянется через три файла? Обычно это заканчивается тем, что модель «забывает» контекст или начинает галлюцинировать в самый ответственный момент. Команда из Alibaba Group выпустила обновление своей серии моделей — Qwen3.6, и, кажется, они всерьез нацелились на решение этих проблем.

Я слежу за семейством Qwen еще с версии 2.5, и тогда они уже удивляли своей эффективностью в бенчмарках. Но свежий релиз Qwen3.6 (и промежуточный 3.5) — это не просто очередной «прирост попугаев». Разработчики сфокусировались на том, что они называют Agentic Coding и Thinking Preservation. Давайте разберемся, стоит ли перетаскивать на это свои пайплайны.

Что изменилось под капотом

Если в Qwen3 упор делали на общую эрудицию, то версия 3.6 — это работа над ошибками и запросами сообщества. Главная фишка здесь в сохранении контекста размышлений. Раньше как было: вы ведете длинный диалог, уточняете детали, и в какой-то момент модель теряет нить рассуждений, которая привела её к текущему решению. Новая фича Thinking Preservation удерживает этот «внутренний монолог» в истории переписки. Это реально экономит нервы при итеративной разработке.

Проект Qwen3.5, который лег в основу текущей версии, тоже принес пачку архитектурных изменений. Например, они внедрили гибридную архитектуру: Gated Delta Networks в паре со знакомым многим Mixture-of-Experts (MoE). На практике это дает высокую пропускную способность при низких задержках. Проще говоря, модель отвечает быстрее и «стоит» по ресурсам дешевле, чем монолитные аналоги той же мощности.

Чем это полезно для разработчика

Работа с кодом на уровне агентов

В README часто мелькает термин Agentic Coding. Это история про то, когда вы не просто просите «напиши мне функцию», а даете модели задачу разобраться с фронтенд-воркфлоу или провести рефакторинг на уровне всего репозитория. Qwen3.6 стала гораздо аккуратнее работать с файловой структурой и зависимостями.

Мультимодальность по умолчанию

Версия 3.5 научилась понимать мир не только через текст. Она обучалась на триллионах мультимодальных токенов. Это значит, что вы можете скинуть ей скриншот бага в верстке или схему архитектуры, и она поймет, что там происходит, так же хорошо, как если бы вы описали это текстом.

Поддержка языков

Они расширили поддержку до 201 языка. Для нас это значит, что с русским языком и специфическим сленгом в комментариях код-ревью проблем быть не должно.

Как запустить и пощупать

Ребята из QwenLM молодцы в плане доступности. Вам не обязательно арендовать сервер за тысячу долларов в месяц, чтобы просто попробовать модель.

Самый простой путь: Qwen Studio

Если лень что-то настраивать, идете в Qwen Studio. Там есть и веб-интерфейс, и мобильные приложения. Работает как привычный чат, но с доступом к самым свежим моделям.

Локальный запуск через llama.cpp или MLX

Для любителей приватности и локального инференса есть поддержка llama.cpp. Просто ищите веса в формате GGUF на Hugging Face. Если у вас Mac на Apple Silicon, берите mlx-lm или mlx-vlm (если нужна работа с изображениями). Это, пожалуй, самый быстрый способ запустить 35B модель на обычном ноутбуке.

Пример запуска сервера через transformers, если у вас установлена библиотека:

transformers serve --port 8000 --continuous-batching

После этого можно общаться с моделью прямо в терминале:

transformers chat Qwen/Qwen3.6-35B-A3B

Бенчмарки и производительность

Цифры в README выглядят убедительно. Модель 35B-A3B (это MoE-вариант) показывает результаты, сопоставимые с гораздо более тяжелыми моделями.

Бенчмарки Qwen3.6-35B-A3B

Особенно радует прогресс в задачах на рассуждение (Reasoning) и кодинг. На графиках видно, что даже средние по размеру модели Qwen3.5/3.6 уверенно обходят специализированные решения прошлых поколений.

Бенчмарки средних моделей

Стоит ли внедрять в свои проекты

Qwen3.6 кажется очень сбалансированным решением. Лицензия Apache 2.0 позволяет использовать веса в коммерческих продуктах без головной боли.

Кому это точно зайдет:

  1. Тем, кто строит своих AI-агентов для автоматизации рутины в коде.
  2. Командам, которым нужна локальная LLM для анализа документации и внутреннего софта.
  3. Разработчикам расширений для IDE, где важна скорость отклика и точность контекста.

Из минусов я бы отметил, что документация пока находится в процессе наполнения (User Guide помечен как coming soon). Но учитывая, насколько активно сообщество в Discord и на GitHub, разобраться в деталях не составит труда.

Если вы давно искали альтернативу закрытым моделям, которая не тормозит и адекватно пишет код — Qwen3.6 определенно заслуживает того, чтобы потратить вечер на её запуск и тесты в ваших реальных задачах.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.