MediaCrawler — Как легко собирать данные с китайских платформ без головной боли

01 Jul, 2026
54,783
🔱 11,126
👥 228

Знаете, что общего между маркетологами, аналитиками и исследователями соцсетей? Все они сталкиваются с одной проблемой — как легально и удобно получать данные с китайских платформ, где традиционные методы парсинга часто не работают. Именно эту боль решает MediaCrawler.

Что это за зверь?

MediaCrawler — это не просто очередной парсер. Это умная система, которая использует браузерную автоматизацию через Playwright для сбора данных с семи популярных китайских платформ:

  • Xiaohongshu («Красная книжка»)
  • Douyin (китайский TikTok)
  • Kuaishou
  • Bilibili
  • Weibo
  • Baidu Tieba
  • Zhihu

Интересный факт: проект собрал более 33 тысяч звезд на GitHub, что говорит о его востребованности среди разработчиков.

Чем отличается от других парсеров?

Главная фишка — работа через сохранение сессии пользователя. Вместо того чтобы:

  1. Ломать голову над reverse engineering API
  2. Разбираться с постоянно меняющимися токенами
  3. Бороться с капчами

MediaCrawler просто логинится через QR-код (как обычный пользователь) и сохраняет сессию. Гениально и просто!

Реклама

Кому это нужно?

  1. Маркетологам, анализирующим китайский рынок
  2. Исследователям соцсетей
  3. Разработчикам, которым нужно интегрировать данные в свои приложения
  4. Аналитикам, строящим дашборды по трендам
  5. Любопытным, изучающим китайский цифровой ландшафт

Топ-5 возможностей, которые впечатляют

  1. Работа через QR-код — никаких паролей в коде
  2. Поддержка прокси — можно использовать ротацию IP
  3. Гибкие форматы вывода — SQLite, MySQL, CSV или JSON
  4. Сбор комментариев (включая вложенные!)
  5. Генерация облака слов из комментариев — готовый аналитический инструмент

Кстати, вот так выглядит таблица поддержки функций для разных платформ:

Таблица возможностей

Как это работает технически?

Проект использует:

  • Playwright для браузерной автоматизации
  • uv (новый быстрый менеджер пакетов Python)
  • SQLite/MySQL для хранения данных
  • WordCloud для визуализации комментариев

Интересный момент: разработчик предлагает Pro-версию с:

  • Поддержкой Linux
  • Удалением зависимости от Playwright
  • Возможностью продолжения прерванного сбора данных

Практическое применение

  1. Анализ конкурентов: соберите посты и комментарии с Xiaohongshu по ключевым словам
  2. Исследование трендов: отслеживайте популярные темы на Douyin
  3. Мониторинг бренда: анализируйте упоминания в Weibo
  4. Академические исследования: изучайте поведение пользователей Zhihu

Важно: юридические аспекты

Автор четко указывает:

«Проект предназначен только для образовательных целей. Любое коммерческое использование или нарушение правил платформ — на ваш страх и риск»

Как начать использовать?

  1. Установите зависимости:
uv sync
playwright install
  1. Запустите сбор данных для Xiaohongshu:
uv run main.py --platform xhs --lt qrcode --type search
  1. Отсканируйте QR-код из приложения

Вывод: стоит ли пробовать?

Если вам нужно:

  • Изучать китайские соцсети
  • Анализировать азиатские тренды
  • Интегрировать данные в свои проекты

MediaCrawler — отличное решение. Оно особенно ценно тем, что:

✅ Обходит сложные системы защиты платформ ✅ Имеет подробную документацию ✅ Поддерживает все основные китайские сервисы

Проект активно развивается (последнее обновление — июль 2025), имеет большое сообщество и альтернативную Pro-версию для продвинутых сценариев.

P.S. Если решите попробовать — не забудьте поставить звезду автору на GitHub. Такие проекты заслуживают поддержки!

Star History Chart

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.