Generic Extractor
Универсальный экстрактор, не зависящий от сайта - извлекает ссылки, изображения, заголовки и основное содержимое с любой веб-страницы.
Использование API
Добавьте &scraper=generic-extractor к запросу Crawling API. URL-кодируйте целевой URL в параметре url.
curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
--data-urlencode 'url=https://stackoverflow.com/' \
--data-urlencode 'scraper=generic-extractor' -Gfrom crawlbase import CrawlingAPI
api = CrawlingAPI({'token': 'YOUR_TOKEN'})
res = api.get(
'https://stackoverflow.com/',
{'scraper': 'generic-extractor'}
)
import json
data = json.loads(res['body'])const { CrawlingAPI } = require('crawlbase');
const api = new CrawlingAPI({ token: 'YOUR_TOKEN' });
const res = await api.get(
'https://stackoverflow.com/',
{ scraper: 'generic-extractor' }
);
const data = JSON.parse(res.body);require 'crawlbase'
api = Crawlbase::API.new(token: 'YOUR_TOKEN')
res = api.get('https://stackoverflow.com/', scraper: 'generic-extractor')
data = JSON.parse(res.body)Пример входного URL
URL, передаваемый в параметре url (URL-декодирован для удобства чтения):
https://stackoverflow.com/Структура ответа
Тело ответа в формате JSON. Значения полей могут быть null, если исходная страница не содержит соответствующих данных.
Итоговый URL.
Тег заголовка страницы.
Meta description.
Канонический link.
Определённый язык.
Массивы текста заголовков h1/h2/h3.
Исходящие ссылки с href, text, rel.
URL изображений с alt-текстом.
Извлечённый читаемый текст тела страницы.
Пример ответа
{
"url": "https://stackoverflow.com/",
"title": "Stack Overflow - Where Developers Learn...",
"language": "en",
"headings": {
"h1": ["Where developers grow together"],
"h2": ["Hot Network Questions"]
}
}