Скрапер, который сработал один раз, доказал ровно одно: что один запрос, с одного выхода, в один момент времени вернул контент. Он не сказал вам, как часто отвечает эта цель, сколько времени это занимает, сколько стоит страница, выполняет ли браузер хоть какую-то работу и вокруг каких форм URL этого сайта группируются сбои. Именно эти цифры решают, стоит ли строить конвейер, и обычно их выясняют уже после того, как конвейер создан.
Справочник Crawlbase Web Scraping Cookbook публикует их заранее. Это одна страница на сайт, и каждая страница измеряется на реальном трафике Crawlbase до того, как будет написана хоть строка: доля успешных запросов, медианное время ответа, цена в кредитах, какая часть успешного трафика использовала браузер, какой страновой маршрут задавали выигрышные вызовы, какие шаблоны URL дают успехи и какими на самом деле были сбои. Сейчас он охватывает 17 739 измеренных сайтов и 356 рецептов, по данным за август 2026, с обновлением каждый месяц.
- Доля успешных запросов сама по себе не является профилем. Два сайта с 98 % могут различаться в 20 раз по задержке и в 20 раз по цене.
- Рендеринг в браузере определяется измерением, а не берётся по умолчанию. На четырёх из шести сайтов ниже выигрывает обычный токен, а браузер не даёт ничего.
- Страновая маршрутизация относится к тому же типу вопросов. Она сдвигает Trustpilot на четыре пункта и вообще ничего не даёт остальным.
- Классы сбоев служат инструкциями. 429 означает снизить темп вызовов, 403 означает исправить выход, 5xx означает подождать.
- Цифры описывают измеренное окно, а не гарантию, поэтому их пересчитывают каждый месяц.
Что измеряет рецепт
Каждая страница строится на наблюдаемом трафике к этому сайту, а не на тестовом прогоне, выполненном ради самой страницы. Это те измерения, вокруг которых конвейеру действительно приходится планировать работу.
| Измерение | На какой вопрос отвечает | На что влияет |
|---|---|---|
| Доля успешных запросов | Как часто вызовы к этому сайту возвращают контент | Бюджет повторов и стоит ли цель того, чтобы строить конвейер |
| Медианный ответ | Сколько времени занимает типичный вызов | Параллелизм, планирование, клиентские тайм-ауты |
| Цена в кредитах | Сколько стоит одна страница, по сложности домена, с удвоением при запросе с JavaScript | Юнит-экономика до масштабирования, а не после |
| Доля браузера | Какая часть выигрышного трафика использовала токен JavaScript | Требуется ли рендеринг или он просто дорог |
| Страна | Какой выход использовали успешные вызовы | Оправдывает ли country=XX своё место |
| Шаблоны URL | В каких формах страниц сосредоточены успехи | Что реализовать и проверить в первую очередь |
| Классы сбоев | Что ответил сайт, когда отказал | Логика повторов, соответствующая отказу |
Одну деталь в подсчёте успехов стоит назвать прямо, потому что она меняет смысл показателя. Сайт, который отвечает 200 страницей блокировки или стеной согласия, контент не вернул, поэтому Cookbook засчитывает это как сбой, а не как успех. У Google этот класс, самая крупная категория сбоев, 33,8 %.
Шесть сайтов, шесть разных форм
Быстрее всего понять, почему одной цифры недостаточно, можно, поставив рядом шесть реальных рецептов. Все приведённые ниже цифры взяты из измерений за август 2026, опубликованных на каждой странице, а шаблоны и сбои прочитаны из журнала запросов начиная с 14 августа 2026.
Google: быстро, достаточно дёшево, без браузера
Страница рецепта google.com показывает 97,0 % успеха, медианный ответ 1,9 секунды и 2 кредита за страницу. Вызовы с обычным токеном успешны в 96,9 % случаев и несут 99,8 % трафика, поэтому браузер здесь даёт только расходы. Доминируют страницы поиска: /search составляет 98,3 % успешных запросов, а 6,3 % вызовов обращаются к скраперу google-serp , чтобы получить структурированный JSON вместо HTML. Сбои делятся почти поровну между страницами блокировки или согласия, отданными как 200 (33,8 %), и запросами, которые так и не ответили в пределах тайм-аута (33,5 %), при 23,5 % ограничений частоты.
LinkedIn: надёжный, медленный и дорогой
Страница рецепта linkedin.com показывает 98,0 % успеха, медианный ответ 14,7 секунды и 20 кредитов за страницу, ценовой уровень Extreme II. Вызовы с обычным токеном успешны в 99,9 % случаев и составляют 96,0 % трафика. Успехи сосредоточены на страницах вакансий (41,5 %), страницах компаний (27,3 %) и профилях (18,5 %). В сбоях преобладает собственный статус отказа сайта, 999, с долей 58,5 %, а ответы 591 составляют 27,1 %.
LinkedIn лучше всего показывает, зачем читать профиль целиком. По доле успешных запросов это второй по надёжности сайт в группе. По стоимости страницы он в двадцать раз дороже Target, а по задержке в девять раз медленнее Google.
Allegro: почти идеально и без спешки
Страница рецепта allegro.pl показывает 99,7 % успеха, медианный ответ 16,5 секунды и 2 кредита за страницу. Весь успешный трафик использует обычный токен. Страницы товаров по пути /produkt/{slug} дают 77,3 % успехов. В сбоях лидируют тайм-ауты (44,3 %), затем 403 отказы (36,9 %) и 400 ответы (12,8 %).
Target: дешёвый и быстрый, но с ограничением частоты
Страница рецепта target.com показывает 96,4 % успеха, медианный ответ 1,6 секунды и 1 кредит за страницу. Вызовы с обычным токеном успешны в 97,7 % случаев и несут 97,2 % трафика, а две формы URL товаров вместе покрывают 99,3 % успехов. Интереснее всего профиль сбоев: 48,1 % приходится на ограничения частоты 429, далее идут 403 с 32,4 % и тайм-ауты с 13,3 %. Дёшево и быстро, но сайт сопротивляется темпу, а это задача планирования, а не конфигурации.
Trustpilot: случай, где важны и рендеринг, и страна
Страница рецепта trustpilot.com показывает 90,9 % успеха, медианный ответ 32,0 секунды и 1 кредит за страницу, 2 кредита на токене JavaScript, который нужен этому рецепту. Это тот сайт в группе, где конфигурация меняет и результат, и счёт. Вызовы с токеном JavaScript успешны в 94,0 % против 29,5 % у обычного токена, и 94,0 % вызовов используют именно его. Страновая маршрутизация тоже меняет результат: 46,2 % успешных вызовов задают выход в США и успешны в 92,4 %, против 88,2 % без заданной страны. Отзывы по пути /review/{slug} составляют 97,5 % успехов. В сбоях лидируют 403 с 45,9 %.
Именно этот вызов рекомендует рецепт, и именно его стоит скопировать, потому что он несёт оба решения сразу:
curl "https://api.crawlbase.com/?token=YOUR_JS_TOKEN&country=US&url=https%3A%2F%2Fwww.trustpilot.com%2Freview%2Fsd.se"
QQ.com: почти идеально, и браузер всё равно нужен
Страница рецепта qq.com показывает 99,9 % успеха, медианный ответ 6,1 секунды и 1 кредит за страницу, 2 кредита на токене JavaScript, который нужен этому рецепту. Это самый надёжный сайт в группе, и рендеринг ему всё равно нужен: вызовы с токеном JavaScript успешны в 100 % против 86,8 % у обычного токена, и 98,9 % вызовов используют именно его. Страницы тегов дают 99,8 % успехов. Большинство сбоев приходится на собственные ответы 5xx сайта, вместе 72,4 %.
QQ.com и Trustpilot показывают одно и то же с противоположных сторон. Итоговая доля успешных запросов не говорит, нужен ли браузер, потому что она уже отражает тот факт, что вызывающая сторона его использует.
Шесть сайтов рядом
| Сайт | Успех | Медианный ответ | Цена | Браузер | Страна | Картина |
|---|---|---|---|---|---|---|
| google.com | 97,0 % | 1,9 с | 2 кредита | Нет | Нет | Быстро и просто |
| linkedin.com | 98,0 % | 14,7 с | 20 кредитов | Нет | Нет | Надёжно, медленно, дорого |
| allegro.pl | 99,7 % | 16,5 с | 2 кредита | Нет | Нет | Надёжно, но медленно |
| target.com | 96,4 % | 1,6 с | 1 кредит | Нет | Нет | Дёшево, быстро, с ограничением частоты |
| trustpilot.com | 90,9 % | 32,0 с | 2 кредита на JS | Да | США помогает | Решает конфигурация |
| qq.com | 99,9 % | 6,1 с | 2 кредита на JS | Да | Нет | Надёжно, зависит от рендеринга |
Как читать рецепт до написания скрапера
Практическая польза профиля в том, что он убирает этап угадывания в начале интеграции, где и теряется большая часть усилий.
Начинайте с конфигурации, которая уже выигрывает
Каждый рецепт называет токен и страну, которые использовал успешный трафик, поэтому первый вызов делается осознанно, а не наугад. Для сайта с обычным токеном, такого как Google, это вся конфигурация целиком:
from crawlbase import CrawlingAPI api = CrawlingAPI({'token': 'YOUR_TOKEN'}) r = api.get('https://www.google.com/search') html = r['body']
Добавляйте браузер только там, где этого требует измерение
Рендеринг остаётся самым частым рефлексом и самой частой тратой. Google, LinkedIn, Allegro и Target в наблюдаемом трафике обрабатываются обычным токеном, поэтому браузер там добавляет стоимость и задержку к вызову, который и так работал. Trustpilot и QQ.com представляют обратный случай, где рендеринг даёт разницу между 94,0 % и 29,5 % или между 100 % и 86,8 %. В Crawling API запросить его можно двумя способами: сделать вызов через токен JavaScript, либо сделать вызов с обычным токеном и добавить javascript=true, что переключает вас на ключ JavaScript до начала загрузки, поэтому одного ключа хватает на всё. В Smart AI Proxy тот же переключатель передаётся как javascript=true в CrawlbaseAPI-Parameters (заголовок). Любой из этих путей тарифицируется как запрос с JavaScript, откуда и берётся удвоенная цена в кредитах на этих двух сайтах.
Пусть класс сбоя выбирает повтор
Разбивка сбоев окупается уже после запуска, потому что каждый класс требует своей реакции. Немедленный повтор 429 воспроизводит его. Повтор 403 без смены выхода воспроизводит его тоже.
- 429 означает, что сайт задаёт вам темп. Разнесите вызовы во времени или передайте их в Crawler, который сам задаёт им темп. Половина сбоев Target относится к этому классу.
- 403 означает отказ выходу. Задайте страну, которую используют успешные вызовы, и повторите один раз; второй отказ обычно означает, что защищён сам URL.
- 5xx означает сбой сайта, а не загрузки. Подождите и повторите позже. На QQ.com это почти три четверти всех сбоев.
- Тайм-ауты означают, что страница не успела завершиться в пределах лимита. Держите клиентский тайм-аут выше медианного ответа сайта, именно поэтому рецепт его и публикует.
- Ответ 200 со страницей блокировки или согласия, это сбой под видом успешного статуса. Он не тарифицируется, и именно поэтому проверять нужно контент, а не статус.
Рецепты измеряются на нём: одна конечная точка, рендеринг в браузере и обработка антибот-защиты внутри загрузки, а также cb_status , сообщающий, вернулась ли страница. Неуспешные запросы не тарифицируются. Начните бесплатно, до 5 000 запросов, без карты.
От рецепта к конвейеру
Профиль подходит для ранней части разработки, где неизвестные дешевле всего устранять.
Для команды, которая выбирает инфраструктуру, а не пишет загрузку, те же цифры отвечают на другой вопрос. Надёжность, задержка и цена относятся к конкретной цели, а не к платформе, поэтому вопрос «можете ли вы собрать этот сайт» менее полезен, чем «сколько стоит этот сайт, насколько он медленный и что он делает при отказе». Шесть сайтов выше укладываются в диапазон от 1 до 20 кредитов за страницу и от 1,6 до 32,0 секунды, на одной платформе. Моделирование затрат начинается с цены цели:
100,000 pages x 1 credit = 100,000 credits (target.com) 100,000 pages x 20 credits = 2,000,000 credits (linkedin.com)
Калькулятор стоимости превращает эти кредиты в ежемесячную сумму. Суть в том, что множитель можно узнать до того, как конвейер появится, а не после первого счёта.
О чём цифры не говорят
Рецепт описывает измеренный трафик за указанное окно. Это не обещание на завтра и не утверждение, что каждая страница сайта ведёт себя так же, как страницы в выборке. Сайты меняют защиту, ротируют инфраструктуру и перенастраивают ограничения частоты, поэтому каждая страница несёт месяц измерения и дату последней проверки и поэтому весь набор обновляется ежемесячно, а не стареет. Когда сайт перестаёт отвечать, его рецепт удаляют, а не хранят как документацию того, что больше не работает.
Шаблоны и классы сбоев взяты из журнала запросов начиная с 14 августа 2026, поэтому они описывают формы страниц, которые аккаунты Crawlbase действительно загружают. Форма URL, которую никто не запрашивает, не появится, даже если сайт её отдаёт.
Заключение
Большинство решений о скрапинге принимаются дважды: сначала на основе предположений, а затем снова, когда трафик показывает, что сайт делает на самом деле. Cookbook сдвигает вторую версию раньше. Ещё до написания экстрактора вы видите, как часто отвечает цель, сколько времени это занимает, сколько стоит страница, выполняет ли браузер хоть какую-то работу, какой выход используют выигрышные вызовы, какие формы URL несут успехи и какими были отказы.
Найдите свою цель в справочнике Cookbook, начните с вызова, который подкреплён измерениями, и создайте бесплатный аккаунт для запуска на собственной нагрузке.
Часто задаваемые вопросы (FAQ)
Откуда берутся цифры Cookbook?
Из трафика Crawlbase к этому сайту: каждый запрос от каждого аккаунта за указанный месяц для доли успешных запросов и журнал запросов начиная с 14 августа 2026 для шаблонов, стран и классов сбоев. Это измерения наблюдаемого трафика за то окно, а не гарантии будущей производительности, и ни один клиент или аккаунт нигде в данных не идентифицируется.
Означает ли «нужен браузер», что я должен сам запускать браузер?
Нет. Это означает, что цели нужен рендеринг JavaScript, и Crawlbase выполняет этот рендеринг. В Crawling API и Crawler вы запрашиваете его через токен JavaScript или через ваш обычный токен плюс javascript=true, что переключает ключи до начала загрузки; в Smart AI Proxy вы передаёте javascript=true в CrawlbaseAPI-Parameters (заголовок). Оба способа тарифицируются как запрос с JavaScript.
Можно ли оценить стоимость цели до начала разработки?
Да, и в этом основной смысл. Рецепт публикует цену в кредитах за страницу на этом сайте, заданную её сложностью домена, поэтому количество страниц, умноженное на цену, даёт цифру в кредитах, а калькулятор переводит её в деньги. При этом следите за колонкой браузера: сайт, которому нужен рендеринг, тарифицируется по удвоенной цифре JavaScript, поэтому Trustpilot и QQ.com стоят 2 кредита за страницу, а не 1. Фактическое потребление всё равно зависит от вашей конфигурации и от того, через какой продукт вы направляете трафик.
Почему ответ 200 иногда считается сбоем?
Потому что страница блокировки или стена согласия, отданные со статусом 200 не являются тем контентом, который вы запрашивали. Засчитывать это как успех значило бы завысить все показатели по сайту и скрыть самый частый способ отказа современных целей. Такие ответы тоже не тарифицируются.
Как часто обновляется рецепт?
Ежемесячно. Каждая страница указывает месяц, на данных которого сделаны измерения, и дату последней проверки, поэтому устаревший профиль виден, а не скрыт. Рецепты сайтов, которые перестали отвечать, удаляются, а не остаются на месте.
Обходите любой сайт в масштабе, без борьбы с инфраструктурой.
Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.
