LLM Scraper Веб-скрапинг нового поколения с помощью языковых моделей

22 июл 2025
6,921
453
35
3 дня

Когда традиционный скрапинг бессилен

Представьте ситуацию: вам нужно регулярно собирать данные с сайта, где нет API, а структура страниц постоянно меняется. Традиционные парсеры на базе XPath или CSS-селекторов ломаются после каждого обновления дизайна. Знакомо? Именно эту проблему решает LLM Scraper — TypeScript-библиотека, которая использует мощь языковых моделей (LLM) для извлечения структурированных данных из любых веб-страниц.

Что такое LLM Scraper?

LLM Scraper — это инструмент, который сочетает в себе:

  • Автоматизацию браузера через Playwright
  • Возможности современных LLM (GPT, Claude, Gemini и других)
  • Систему типов TypeScript
  • Поддержку схем данных через Zod или JSON Schema

5 причин попробовать LLM Scraper

  1. Работа с любыми сайтами — даже с теми, где нет четкой структуры HTML
  2. Поддержка всех популярных LLM — OpenAI, Anthropic, Google, Groq, Ollama
  3. Разные форматы обработки — от чистого HTML до скриншотов для мультимодальных моделей
  4. Генерация кода — библиотека может создавать готовые скрипты для Playwright
  5. Потоковая обработка — получение данных по мере их извлечения

Как это работает на практике?

Вот пример извлечения топ-новостей с Hacker News:

import { chromium } from 'playwright';
import { z } from 'zod';
import { openai } from '@ai-sdk/openai';
import LLMScraper from 'llm-scraper';

// Инициализация браузера и LLM
const browser = await chromium.launch();
const llm = openai.chat('gpt-4o');
const scraper = new LLMScraper(llm);

// Загрузка страницы
const page = await browser.newPage();
await page.goto('https://news.ycombinator.com');

// Определение схемы данных
const schema = z.object({
  top: z.array(
    z.object({
      title: z.string(),
      points: z.number(),
      by: z.string(),
      commentsURL: z.string(),
    })
  ).length(5).describe('Top 5 stories on Hacker News'),
});

// Запуск скрапера
const { data } = await scraper.run(page, schema, { format: 'html' });
console.log(data.top);

Кому особенно пригодится?

  • Аналитикам данных — для сбора информации с множества источников
  • Маркетологам — мониторинг цен, отзывов, новостей
  • Разработчикам — интеграция данных в свои приложения
  • Исследователям — автоматизация сбора научных данных

LLM Scraper — это не просто еще один инструмент для скрапинга, а принципиально новый подход к извлечению данных из интернета. Он особенно полезен в случаях, когда традиционные методы не работают или требуют постоянного обслуживания.

Уже более 5000 разработчиков оценили этот проект на GitHub. Возможно, и вам стоит попробовать?

Реклама

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.