LLM Scraper Веб-скрапинг нового поколения с помощью языковых моделей
Когда традиционный скрапинг бессилен
Представьте ситуацию: вам нужно регулярно собирать данные с сайта, где нет API, а структура страниц постоянно меняется. Традиционные парсеры на базе XPath или CSS-селекторов ломаются после каждого обновления дизайна. Знакомо? Именно эту проблему решает LLM Scraper — TypeScript-библиотека, которая использует мощь языковых моделей (LLM) для извлечения структурированных данных из любых веб-страниц.
Что такое LLM Scraper?
LLM Scraper — это инструмент, который сочетает в себе:
- Автоматизацию браузера через Playwright
- Возможности современных LLM (GPT, Claude, Gemini и других)
- Систему типов TypeScript
- Поддержку схем данных через Zod или JSON Schema
5 причин попробовать LLM Scraper
- Работа с любыми сайтами — даже с теми, где нет четкой структуры HTML
- Поддержка всех популярных LLM — OpenAI, Anthropic, Google, Groq, Ollama
- Разные форматы обработки — от чистого HTML до скриншотов для мультимодальных моделей
- Генерация кода — библиотека может создавать готовые скрипты для Playwright
- Потоковая обработка — получение данных по мере их извлечения
Как это работает на практике?
Вот пример извлечения топ-новостей с Hacker News:
import { chromium } from 'playwright';
import { z } from 'zod';
import { openai } from '@ai-sdk/openai';
import LLMScraper from 'llm-scraper';
// Инициализация браузера и LLM
const browser = await chromium.launch();
const llm = openai.chat('gpt-4o');
const scraper = new LLMScraper(llm);
// Загрузка страницы
const page = await browser.newPage();
await page.goto('https://news.ycombinator.com');
// Определение схемы данных
const schema = z.object({
top: z.array(
z.object({
title: z.string(),
points: z.number(),
by: z.string(),
commentsURL: z.string(),
})
).length(5).describe('Top 5 stories on Hacker News'),
});
// Запуск скрапера
const { data } = await scraper.run(page, schema, { format: 'html' });
console.log(data.top);
Кому особенно пригодится?
- Аналитикам данных — для сбора информации с множества источников
- Маркетологам — мониторинг цен, отзывов, новостей
- Разработчикам — интеграция данных в свои приложения
- Исследователям — автоматизация сбора научных данных
LLM Scraper — это не просто еще один инструмент для скрапинга, а принципиально новый подход к извлечению данных из интернета. Он особенно полезен в случаях, когда традиционные методы не работают или требуют постоянного обслуживания.
Уже более 5000 разработчиков оценили этот проект на GitHub. Возможно, и вам стоит попробовать?
