crawlbaseДокументация
Войти

Использование API

Добавьте &scraper=generic-extractor к запросу Crawling API. URL-кодируйте целевой URL в параметре url.

curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
  --data-urlencode 'url=https://stackoverflow.com/' \
  --data-urlencode 'scraper=generic-extractor' -G
from crawlbase import CrawlingAPI

api = CrawlingAPI({'token': 'YOUR_TOKEN'})
res = api.get(
    'https://stackoverflow.com/',
    {'scraper': 'generic-extractor'}
)

import json
data = json.loads(res['body'])
const { CrawlingAPI } = require('crawlbase');
const api = new CrawlingAPI({ token: 'YOUR_TOKEN' });

const res = await api.get(
  'https://stackoverflow.com/',
  { scraper: 'generic-extractor' }
);
const data = JSON.parse(res.body);
require 'crawlbase'
api = Crawlbase::API.new(token: 'YOUR_TOKEN')

res = api.get('https://stackoverflow.com/', scraper: 'generic-extractor')
data = JSON.parse(res.body)

Пример входного URL

URL, передаваемый в параметре url (URL-декодирован для удобства чтения):

https://stackoverflow.com/

Структура ответа

Тело ответа в формате JSON. Значения полей могут быть null, если исходная страница не содержит соответствующих данных.

url
string
Итоговый URL.
title
string
Тег заголовка страницы.
meta_description
string | null
Meta description.
canonical_url
string | null
Канонический link.
language
string | null
Определённый язык.
headings
object
Массивы текста заголовков h1/h2/h3.
links
array
Исходящие ссылки с href, text, rel.
images
array
URL изображений с alt-текстом.
main_content
string
Извлечённый читаемый текст тела страницы.

Пример ответа

{
  "url": "https://stackoverflow.com/",
  "title": "Stack Overflow - Where Developers Learn...",
  "language": "en",
  "headings": {
    "h1": ["Where developers grow together"],
    "h2": ["Hot Network Questions"]
  }
}