MediaCrawler — Как легко собирать данные с китайских платформ без головной боли
Знаете, что общего между маркетологами, аналитиками и исследователями соцсетей? Все они сталкиваются с одной проблемой — как легально и удобно получать данные с китайских платформ, где традиционные методы парсинга часто не работают. Именно эту боль решает MediaCrawler.
Что это за зверь?
MediaCrawler — это не просто очередной парсер. Это умная система, которая использует браузерную автоматизацию через Playwright для сбора данных с семи популярных китайских платформ:
- Xiaohongshu («Красная книжка»)
- Douyin (китайский TikTok)
- Kuaishou
- Bilibili
- Baidu Tieba
- Zhihu
Интересный факт: проект собрал более 33 тысяч звезд на GitHub, что говорит о его востребованности среди разработчиков.
Чем отличается от других парсеров?
Главная фишка — работа через сохранение сессии пользователя. Вместо того чтобы:
- Ломать голову над reverse engineering API
- Разбираться с постоянно меняющимися токенами
- Бороться с капчами
MediaCrawler просто логинится через QR-код (как обычный пользователь) и сохраняет сессию. Гениально и просто!
Кому это нужно?
- Маркетологам, анализирующим китайский рынок
- Исследователям соцсетей
- Разработчикам, которым нужно интегрировать данные в свои приложения
- Аналитикам, строящим дашборды по трендам
- Любопытным, изучающим китайский цифровой ландшафт
Топ-5 возможностей, которые впечатляют
- Работа через QR-код — никаких паролей в коде
- Поддержка прокси — можно использовать ротацию IP
- Гибкие форматы вывода — SQLite, MySQL, CSV или JSON
- Сбор комментариев (включая вложенные!)
- Генерация облака слов из комментариев — готовый аналитический инструмент
Кстати, вот так выглядит таблица поддержки функций для разных платформ:

Как это работает технически?
Проект использует:
- Playwright для браузерной автоматизации
- uv (новый быстрый менеджер пакетов Python)
- SQLite/MySQL для хранения данных
- WordCloud для визуализации комментариев
Интересный момент: разработчик предлагает Pro-версию с:
- Поддержкой Linux
- Удалением зависимости от Playwright
- Возможностью продолжения прерванного сбора данных
Практическое применение
- Анализ конкурентов: соберите посты и комментарии с Xiaohongshu по ключевым словам
- Исследование трендов: отслеживайте популярные темы на Douyin
- Мониторинг бренда: анализируйте упоминания в Weibo
- Академические исследования: изучайте поведение пользователей Zhihu
Важно: юридические аспекты
Автор четко указывает:
«Проект предназначен только для образовательных целей. Любое коммерческое использование или нарушение правил платформ — на ваш страх и риск»
Как начать использовать?
- Установите зависимости:
uv sync
playwright install
- Запустите сбор данных для Xiaohongshu:
uv run main.py --platform xhs --lt qrcode --type search
- Отсканируйте QR-код из приложения
Вывод: стоит ли пробовать?
Если вам нужно:
- Изучать китайские соцсети
- Анализировать азиатские тренды
- Интегрировать данные в свои проекты
MediaCrawler — отличное решение. Оно особенно ценно тем, что:
✅ Обходит сложные системы защиты платформ ✅ Имеет подробную документацию ✅ Поддерживает все основные китайские сервисы
Проект активно развивается (последнее обновление — июль 2025), имеет большое сообщество и альтернативную Pro-версию для продвинутых сценариев.
P.S. Если решите попробовать — не забудьте поставить звезду автору на GitHub. Такие проекты заслуживают поддержки!
