Скрапинг: страницы sport на bbc.com
Запрос, который сегодня возвращает страницы sport с bbc.com, с параметрами, шаблонами и типами ошибок из лога запросов с 14 Aug 2026.
Измерено на Crawlbase
Доля успеха по каждому запросу каждого аккаунта за August 2026: 97.9%. Шаблоны, страны и сбои взяты из лога запросов с 14 Aug 2026; 22.6% успешных вызовов использовали JavaScript-токен, медианный ответ занял 5.4s.
Среди 74 сайтов категории новости и медиа в Cookbook bbc.com занимает 49 место из 74 по доле успеха; медиана категории 98.9%. Его медианный ответ 5.4s медленнее медианы категории 2.3s. 58 из 74 принимают обычный токен; этот сайт только на части страниц.
Вызов
Страницы статей здесь запрашивают чаще всего, со страной и токеном, которые успешны чаще всего. Замените путь-заполнитель настоящим URL статьи с сайта.
curl "https://api.crawlbase.com/?token=YOUR_TOKEN&url=https%3A%2F%2Fwww.bbc.com%2Fsport%2Fexample-page%2Fexample-page"from crawlbase import CrawlingAPI api = CrawlingAPI({'token': 'YOUR_TOKEN'}) r = api.get('https://www.bbc.com/sport/example-page/example-page') html = r['body']
const { CrawlingAPI } = require('crawlbase'); const api = new CrawlingAPI({ token: 'YOUR_TOKEN' }); const r = await api.get('https://www.bbc.com/sport/example-page/example-page');
Важные параметры
| Параметр | Значение | Зачем |
|---|---|---|
country | не задавать | Большинство успешных вызовов не задают country (86.5%) и срабатывают с долей успеха 99.9%. |
javascript | не задавать | Вызовы с обычным токеном срабатывают с долей успеха 100%, с JavaScript-токеном 98.3%. Работают оба; начните без браузера и переключайтесь по шаблону URL там, где это показывает таблица ниже. |
Шаблоны URL, которые запрашивают аккаунты
| Шаблон | Доля успехов | JavaScript-токен | Страна | Параметры запроса |
|---|---|---|---|---|
/sport/{slug}/{slug} | 45.0% | 91.7% | нет | page, xtor |
/news/{slug}/{slug} | 42.5% | 49.4% | нет | нет |
/ | 2.3% | 0.0% | нет | нет |
/news/{slug} | 2.0% | 75.0% | нет | нет |
/news | 2.0% | 0.0% | нет | нет |
Поля, которые вы получаете
Страница статьи несёт заголовок, дату и автора, обычно в блоке ld+json Article, и текст в HTML. Блок часто называет и рубрику.
Что ломается и как починить
На сбои с 14 Aug 2026 сайт отвечал:
Запуск по расписанию
Новости меняются каждый час. Опрашивайте рубрику или sitemap на новые ссылки, затем отправляйте URL статей в Crawler с callback-адресом, чтобы запросы шли равномерно. Медианный ответ на этом сайте 5.4s.
Вопросы
Нужен ли браузер для скрапинга bbc.com?
Зависит от страницы. Вызовы с обычным токеном срабатывают с долей успеха 100%, с JavaScript-токеном 98.3%; таблица шаблонов URL показывает, какие пути аккаунты запрашивают с браузером.
Сколько стоит страница bbc.com на Crawlbase?
1 кредит без браузера. bbc.com относится к уровню стандартный.
Какой country задать для bbc.com?
Никакой не нужен: большинство успешных вызовов оставляют его незаданным.