Crawling API / Stack Exchange

Скрапер Stack Exchange.
Каждый сайт, полностью отрендеренный.

Отправьте любой URL Stack Exchange и получите полностью отрендеренный HTML через резидентные прокси со встроенной обработкой анти-бот-защиты.
Или получите структурированный JSON со скраперами stackexchange-serp и stackexchange-thread.

99% успешных запросов140M резидентных IP30 регионов
URL Stack ExchangeHTML or JSONstackoverflow.com/questions/2861071CrawlbaseМаршрутизацияРендерингИзвлечениеОтрендеренный HTMLСтруктурированный JSONcrawling-apistackexchange-threadstackoverflow.com · перенаправлено из-за лимита · 200
Живой поток краулинга · Stack Exchange1.24M req/minСтриминг
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileNL142ms
200stackoverflow.com/search?q=async+awaitGB154ms
200askubuntu.com/questions/tagged/aptCA128ms
200unix.stackexchange.com/questions/tagged/bashCA84ms
200serverfault.com/questions/tagged/nginxDE203ms
301stackoverflow.com/search?q=async+awaitDE219ms
200stackoverflow.com/questions/tagged/rustIN209ms
200askubuntu.com/questions/tagged/aptCA208ms
200askubuntu.com/questionsES158ms
200unix.stackexchange.com/questions/tagged/bashNL73ms
404serverfault.com/questionsIN147ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileAU91ms
200stackoverflow.com/questions/tagged/pythonAU58ms
301stackoverflow.com/questions/tagged/pythonCA217ms
200mathoverflow.net/questions/tagged/nt.number-theoryAU152ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileFR111ms
200stackoverflow.com/search?q=async+awaitFR70ms
200superuser.com/questions/tagged/windowsDE116ms
200superuser.com/questions/tagged/windowsUS41ms
200stackoverflow.com/questions/tagged/pythonSG44ms
200mathoverflow.net/questions/tagged/nt.number-theorySG48ms
200stackoverflow.com/search?q=segmentation+faultBR208ms
301unix.stackexchange.com/questions/tagged/bashGB156ms
200security.stackexchange.com/questions/tagged/tlsES215ms
200superuser.com/questions/tagged/windowsES92ms
200superuser.com/questions/tagged/windowsIN60ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileNL142ms
200stackoverflow.com/search?q=async+awaitGB154ms
200askubuntu.com/questions/tagged/aptCA128ms
200unix.stackexchange.com/questions/tagged/bashCA84ms
200serverfault.com/questions/tagged/nginxDE203ms
301stackoverflow.com/search?q=async+awaitDE219ms
200stackoverflow.com/questions/tagged/rustIN209ms
200askubuntu.com/questions/tagged/aptCA208ms
200askubuntu.com/questionsES158ms
200unix.stackexchange.com/questions/tagged/bashNL73ms
404serverfault.com/questionsIN147ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileAU91ms
200stackoverflow.com/questions/tagged/pythonAU58ms
301stackoverflow.com/questions/tagged/pythonCA217ms
200mathoverflow.net/questions/tagged/nt.number-theoryAU152ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileFR111ms
200stackoverflow.com/search?q=async+awaitFR70ms
200superuser.com/questions/tagged/windowsDE116ms
200superuser.com/questions/tagged/windowsUS41ms
200stackoverflow.com/questions/tagged/pythonSG44ms
200mathoverflow.net/questions/tagged/nt.number-theorySG48ms
200stackoverflow.com/search?q=segmentation+faultBR208ms
301unix.stackexchange.com/questions/tagged/bashGB156ms
200security.stackexchange.com/questions/tagged/tlsES215ms
200superuser.com/questions/tagged/windowsES92ms
200superuser.com/questions/tagged/windowsIN60ms
01 Живое демо

Один скрапер, каждый сайт Stack Exchange.

Crawling API, вводимый вживую. Смотрите, как скрапер stackexchange-serp возвращает структурированный JSON с Stack Overflow, Super User, Ask Ubuntu и MathOverflow - один и тот же вызов работает на любом сайте сети. Наведите, чтобы приостановить и прочитать.

готово
клавиши 1-4 переключают · клик для паузызапустите свой URL
Запустите первый запрос за минуты. До 5 000 бесплатных запросов, без кредитной карты.Начать бесплатно
02 Возможности

Один API, вся сеть Stack Exchange.

Оба скрапера host-agnostic, поэтому один и тот же вызов работает на Stack Overflow, Super User, Ask Ubuntu, MathOverflow и каждом сайте *.stackexchange.com. Crawling API рендерит каждую страницу в реальном браузере, достигает её через резидентные IP и выдаёт вам чистый HTML или JSON.

сеть

Каждый сайт Stack Exchange

stackoverflow.com, superuser.com, askubuntu.com, serverfault.com, mathoverflow.net и все сообщества *.stackexchange.com работают через одни и те же два скрапера.

прокси

140M резидентных IP

Stack Exchange ограничивает частоту запросов с датацентровых IP, поэтому каждый запрос ротирует резидентный IP по 30 регионам и достигает каждого сайта как настоящий локальный посетитель.

анти-бот

Блокировки обрабатываются за вас

CAPTCHA, бот-стены и лимиты частоты преодолеваются автоматически. Ничего не нужно решать, ничего не нужно поддерживать.

формат

HTML или JSON

Получите полностью отрендеренный HTML или добавьте scraper=stackexchange-serp или stackexchange-thread, чтобы вернуть списки вопросов и полные треды как структурированный JSON.

дополнения

Скриншоты и асинхронность

Тот же вызов может сделать полностраничный скриншот или выполниться асинхронно с вебхуками и облачным хранилищем.

один токен

Один API для каждого сайта

Crawling API работает с любым URL, поэтому один токен покрывает всю сеть Stack Exchange и всё остальное, что вы краулите. Смотреть живое демо.

03 Вывод

Каждое поле треда как чистый JSON.

Отправьте URL вопроса с scraper=stackexchange-thread и тред возвращается типизированным JSON. Замените на stackexchange-serp, чтобы сделать то же для списков вопросов, тегов и результатов поиска.

{ "question": { "id": "2861071", "title": "How to modify a text file?", "score": 312, "viewCount": 486201, "tags": [ "python", "file" ], "askedAt": "2010-05-18T20:11:33Z", "author": { "name": "Nathan Fellman", "url": "https://stackoverflow.com/users/8460", "reputation": 127843 }, "comments": [ { "score": 3, "createdAt": "2010-05-18T20:19:04Z" } ] }, "answerCount": 2, "answers": [ { "id": "2861108", "score": 401, "isAccepted": true, "body": "Read the file into a list of lines, insert, then write it back.", "author": { "name": "Roberto Bonvallet", "url": "https://stackoverflow.com/users/193568", "reputation": 30215 }, "createdAt": "2010-05-18T20:15:52Z", "comments": [ { "score": 12, "createdAt": "2010-05-18T21:02:11Z" } ] } ] }

Вопрос

question.id · string  question.title · string  question.score · number  question.viewCount · number

Автор

question.author.name · string  question.author.url · string  question.author.reputation · number

Ответы

answerCount · number  answers[].score · number  answers[].isAccepted · boolean  answers[].body · string

Комментарии

question.comments[] · array  answers[].comments[].score · number  answers[].comments[].createdAt · string

Теги

question.tags · array  question.askedAt · string  answers[].createdAt · string

04 Как это работает

От URL до данных за один вызов.

Каждый запрос к Stack Exchange проходит один и тот же путь. Вы отправляете URL, мы управляем всем остальным.

01

Отправьте URL

Передайте любой публичный URL Stack Exchange с вашим токеном: вопрос, тег, поиск или список на любом сайте сети.

02

Ротируйте прокси

Резидентный IP и регион, которые чисто достигают каждого сайта, из 140M IP по 30 регионам.

03

Отрендерьте страницу

Реальный браузер загружает страницу, чтобы оценки, ответы и комментарии отрендерились до захвата.

04

Преодолейте анти-бот

Проверки бота и постраничные лимиты частоты каждого сайта обрабатываются автоматически. Ничего не нужно решать, ничего не нужно поддерживать.

05

Верните HTML или JSON

Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете stackexchange-serp или stackexchange-thread.

05 Сценарии использования

Что команды строят на данных Stack Exchange.

USE / 01Знания

Майнинг знаний разработчиков

Извлекайте вопросы, принятые ответы и комментарии по всей сети, чтобы строить поисковые базы знаний.

USE / 02Обучение

Обучающие данные и RAG

Подавайте чистый текст вопрос-ответ в модели, RAG-пайплайны и кодовые агенты через один API.

USE / 03Тренды

Мониторинг техтрендов

Следите за тегами и страницами поиска по сайтам, чтобы рано замечать растущие языки, инструменты и темы.

USE / 04Q&A

Наборы данных Q&A

Собирайте структурированные наборы данных вопрос, ответ и голос для оценки и бенчмарков.

USE / 05Исследования

Конкурентные и dev-исследования

Анализируйте реальные вопросы, ошибки и обходные пути разработчиков, чтобы информировать продукт и документацию.

USE / 06Охват

Любой URL, один API

Краульте вопросы, теги, страницы пользователей и поиск по сети, плюс любой другой сайт, который вам нужен.

06 Заметки

Полезно знать при скрапинге Stack Exchange.

Одна пара скраперов, каждый сайт

stackexchange-serp и stackexchange-thread host-agnostic, поэтому эти два скрапера покрывают Stack Overflow, Super User, Ask Ubuntu, MathOverflow и все сообщества *.stackexchange.com.

HTML по умолчанию, JSON по запросу

Вы получаете полностью отрендеренный HTML. Добавьте scraper=stackexchange-serp или stackexchange-thread для распарсенного JSON или парсите HTML сами.

Резидентные прокси по замыслу

Stack Exchange ограничивает частоту запросов с датацентровых IP, поэтому запросы идут через резидентный пул. Каждый ротирует свежий IP, поэтому доступ остаётся стабильным.

Достигайте каждого сайта откуда угодно

Геотаргетинг по 30 регионам и 140M резидентных IP означает стабильный доступ без управления прокси.

07 Почему Crawlbase

Создано для краулинга Stack Exchange в масштабе.

Crawling API работает на той же сети, что обслуживает более 46 000 платящих клиентов и 70 000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно патчить, когда сайт Stack Exchange меняется.

99%
Средний процент успешных запросов
140M
Резидентных IP, плюс 98M датацентровых
30
Регионов для точных локальных результатов
20/s
Запросов в секунду по умолчанию, больше по запросу

Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99,99% под капотом.

08 FAQ

Вопросы о скрапинге Stack Exchange.

Отправьте любой URL Stack Exchange в Crawlbase Crawling API с вашим токеном. Crawlbase ротирует резидентный прокси, рендерит страницу в реальном браузере, преодолевает проверки бота и возвращает полностью отрендеренный HTML. Добавьте специализированный скрапер (scraper=stackexchange-serp или stackexchange-thread), чтобы вместо этого получить структурированный JSON.
Да. По умолчанию Crawling API возвращает отрендеренный HTML; добавьте специализированный скрапер (scraper=stackexchange-serp для списков вопросов, тегов и поиска, stackexchange-thread для полного вопроса с его ответами и комментариями), чтобы получить структурированный JSON, или парсите HTML сами.
Оба скрапера host-agnostic, поэтому они работают на stackoverflow.com, всех сайтах *.stackexchange.com, superuser.com, askubuntu.com, serverfault.com и mathoverflow.net через один и тот же API.
Crawlbase маршрутизирует каждый запрос через ротирующиеся резидентные IP по 30 регионам и преодолевает проверки бота автоматически. Stack Exchange ограничивает частоту запросов с датацентровых IP, поэтому резидентный пул сохраняет доступ стабильным, и нечего поддерживать, когда сайт меняет свою конфигурацию.
stackexchange-serp возвращает список вопросов со страницы тега, поиска или списка, каждый с заголовком, оценкой, числом ответов, числом просмотров, тегами и отрывком, плюс пагинация. stackexchange-thread возвращает одну страницу вопроса: полное тело вопроса с каждым ответом и комментарием, включая оценки, статус принятия, репутацию автора и временные метки.
Любой публичный URL: вопросы и их ответы, списки тегов, профили пользователей и страницы результатов поиска на любом сайте сети. Тот же API работает и на любом другом сайте.
Начните бесплатно с 5 000 запросов и без кредитной карты. Платные планы масштабируются с использованием, и тот же токен работает во всех Crawling API и каждом скрапере Crawlbase.

Начните скрапить Stack Exchange.
Забудьте о прокси и лимитах частоты.

Бесплатно для старта с 5 000 запросов. Один токен для Crawling API и каждого скрапера.