Alibaba открыла веса модели Qwen3.8-Flash
Команда Qwen выложила на Hugging Face и ModelScope веса мультимодальной MoE-модели Qwen3.8-Flash. Релиз служит ранним превью архитектуры будущего поколения Qwen4. Базовая модель содержит 125 млрд параметров, дополняется таблицей N-gram эмбеддингов на 51 млрд и активирует 6 млрд параметров на каждый токен.
В основе архитектуры лежит гибридный механизм внимания: блок Gated DeltaNet сжимает историю диалога, а Qwen Sparse Attention отбирает релевантный контекст на уровне микро-блоков. Инженеры также внедрили четырехпоточный механизм Gated Residual и оптимизатор Muon. По данным разработчиков, обучение модели потребовало в девять раз меньше вычислительных ресурсов по сравнению с Qwen3.7-Plus. Базовый контекст составляет 262 144 токена с возможностью расширения до 1 млн через YaRN.
В бенчмарке агентного программирования SWE-bench Pro модель набрала 62,5 балла, а в тесте вызова внешних инструментов Toolathlon Verified показала 73,5%. В облаке Qwen Cloud инференс стоит $0,16 за миллион входных токенов и $0,47 за миллион выходных. Модель также встроена в платформу QwenWork, где ускорила генерацию в два раза и снизила расход токенов на задачу на 75%. Веса распространяются под лицензией Qwen Community License 1.0 с поддержкой в vLLM и SGLang.