Как разобраться в китайском зоопарке нейросетей и зачем это нужно
Когда мы говорим про большие языковые модели, в голове сразу всплывают OpenAI, Anthropic или Meta. Но за «великим файрволом» выросла параллельная вселенная нейросетей, которая по многим параметрам уже обходит западные аналоги. Если вы пробовали запустить DeepSeek или Qwen, то знаете, о чем я. Проблема в том, что китайских моделей сотни, документация часто на иероглифах, а разобраться, что из этого взлетит на домашней видеокарте, — тот еще квест.
Репозиторий Awesome-Chinese-LLM — это, пожалуй, самая полная карта этого дикого востока. Авторы собрали в одном месте больше сотни проектов: от тяжеловесных базовых моделей до узкоспециализированных решений для юристов и врачей.

Что внутри этого каталога
Проект структурирован как классический «awesome-list», но с упором на практическую применимость. Здесь не просто ссылки на GitHub, а систематизированные данные по нескольким направлениям.
Базовые модели и их возможности
Самая ценная часть — сравнительная таблица мейнстримных моделей. Тут собраны Qwen от Alibaba, ChatGLM от разработчиков из Университета Цинхуа, Baichuan и другие. Для каждой модели указаны критичные для разработчика параметры:
- Объем обучающих данных в токенах.
- Максимальная длина контекста (некоторые поддерживают до 200k-256k токенов).
- Лицензия (большинство разрешает коммерческое использование, что редкость для западных Open Weights моделей такого уровня).
Например, если вам нужно решение для работы с длинными документами, список сразу подсветит Yi или XVERSE, которые «переваривают» огромные PDF целиком.
Вертикальные решения
Китайцы очень быстро перешли от общих чат-ботов к доменным моделям. В репозитории есть огромный раздел по микро-тюнингу под конкретные ниши.
В медицине это проекты вроде DoctorGLM или BenTsao. Они натренированы на реальных медицинских графах знаний и диалогах. В юриспруденции — ChatLaw и LAW-GPT, которые умеют ссылаться на конкретные статьи китайского кодекса. Есть даже экзотика вроде StarGLM для астрономов или AgriAgent для сельского хозяйства.
Зачем это нам? Даже если вы не планируете лечить людей в Пекине, архитектура этих решений и подходы к подготовке датасетов — отличный учебник по тому, как делать доменный SFT (Supervised Fine-Tuning).
Технический стек и инструменты
Помимо самих весов моделей, авторы собрали инструменты для их «приручения». Это важно, потому что китайские модели часто используют специфические токенизаторы или оптимизированные слои внимания.
В списке вы найдете:
- Фреймворки для обучения: DeepSpeed Chat и LLaMA Efficient Tuning. Они позволяют дообучать модели на обычных игровых картах через LoRA или QLoRA.
- Инструменты для деплоя: vLLM, LightLLM и LMDeploy. Последний, кстати, показывает производительность в 1.8 раза выше, чем популярный vLLM, при работе с моделями серии InternLM.
- Датасеты: от гигантских корпусов вроде MNBVC (терабайты текстов) до специфических наборов для RLHF и выравнивания ценностей (CValues).

Практическая польза для разработчика
Главный вопрос: зачем лезть в китайские репозитории, если есть Llama 3?
Во-первых, это эффективность. Китайские разработчики традиционно сильны в оптимизации под «железо». Модели вроде MiniCPM или семейства Qwen часто показывают лучшие результаты в бенчмарках при меньшем количестве параметров.
Во-вторых, это работа с кодом и математикой. Тот же DeepSeek-V2 или Qwen2.5 сейчас считаются одними из лучших в мире для генерации кода, обходя GPT-4 во многих тестах. В Awesome-Chinese-LLM собраны ссылки на их специализированные версии и инструкции по запуску.
В-третьих, это готовые RAG-системы. В разделе LangChain приложений лежат ссылки на проекты вроде langchain-ChatGLM, которые позволяют развернуть локальную базу знаний буквально за пару команд в терминале.
Стоит ли пробовать
Если вы занимаетесь внедрением LLM в реальные продукты, игнорировать этот список — значит лишать себя половины доступных инструментов. Да, README местами пестрит иероглифами, но структура проекта позволяет ориентироваться даже с помощью встроенного в браузер переводчика.
Кому этот список пригодится в первую очередь:
- ML-инженерам, которые ищут эффективные базовые модели для дообучения.
- Разработчикам чат-ботов, которым нужны открытые и коммерчески применимые аналоги GPT-4.
- Исследователям, изучающим подходы к созданию вертикальных (отраслевых) нейросетей.
Проект живой, обновляется регулярно, а количество звезд (уже за 22 тысячи) говорит о том, что это не просто свалка ссылок, а реальный стандарт индустрии в своем сегменте. С учетом того, как быстро сейчас доминируют модели вроде DeepSeek, этот репозиторий скоро станет обязательной закладкой для любого AI-разработчика.
