Скрапер Stack Exchange.
Каждый сайт, полностью отрендеренный.
Отправьте любой URL Stack Exchange и получите полностью отрендеренный HTML через резидентные прокси со встроенной обработкой анти-бот-защиты.
Или получите структурированный JSON со скраперами stackexchange-serp и stackexchange-thread.
Один скрапер, каждый сайт Stack Exchange.
Crawling API, вводимый вживую. Смотрите, как скрапер stackexchange-serp возвращает структурированный JSON с Stack Overflow, Super User, Ask Ubuntu и MathOverflow - один и тот же вызов работает на любом сайте сети. Наведите, чтобы приостановить и прочитать.
Один API, вся сеть Stack Exchange.
Оба скрапера host-agnostic, поэтому один и тот же вызов работает на Stack Overflow, Super User, Ask Ubuntu, MathOverflow и каждом сайте *.stackexchange.com. Crawling API рендерит каждую страницу в реальном браузере, достигает её через резидентные IP и выдаёт вам чистый HTML или JSON.
Каждый сайт Stack Exchange
stackoverflow.com, superuser.com, askubuntu.com, serverfault.com, mathoverflow.net и все сообщества *.stackexchange.com работают через одни и те же два скрапера.
140M резидентных IP
Stack Exchange ограничивает частоту запросов с датацентровых IP, поэтому каждый запрос ротирует резидентный IP по 30 регионам и достигает каждого сайта как настоящий локальный посетитель.
Блокировки обрабатываются за вас
CAPTCHA, бот-стены и лимиты частоты преодолеваются автоматически. Ничего не нужно решать, ничего не нужно поддерживать.
HTML или JSON
Получите полностью отрендеренный HTML или добавьте scraper=stackexchange-serp или stackexchange-thread, чтобы вернуть списки вопросов и полные треды как структурированный JSON.
Скриншоты и асинхронность
Тот же вызов может сделать полностраничный скриншот или выполниться асинхронно с вебхуками и облачным хранилищем.
Один API для каждого сайта
Crawling API работает с любым URL, поэтому один токен покрывает всю сеть Stack Exchange и всё остальное, что вы краулите. Смотреть живое демо.
Каждое поле треда как чистый JSON.
Отправьте URL вопроса с scraper=stackexchange-thread и тред возвращается типизированным JSON. Замените на stackexchange-serp, чтобы сделать то же для списков вопросов, тегов и результатов поиска.
Вопрос
question.id · string question.title · string question.score · number question.viewCount · number
Автор
question.author.name · string question.author.url · string question.author.reputation · number
Ответы
answerCount · number answers[].score · number answers[].isAccepted · boolean answers[].body · string
Комментарии
question.comments[] · array answers[].comments[].score · number answers[].comments[].createdAt · string
Теги
question.tags · array question.askedAt · string answers[].createdAt · string
От URL до данных за один вызов.
Каждый запрос к Stack Exchange проходит один и тот же путь. Вы отправляете URL, мы управляем всем остальным.
Отправьте URL
Передайте любой публичный URL Stack Exchange с вашим токеном: вопрос, тег, поиск или список на любом сайте сети.
Ротируйте прокси
Резидентный IP и регион, которые чисто достигают каждого сайта, из 140M IP по 30 регионам.
Отрендерьте страницу
Реальный браузер загружает страницу, чтобы оценки, ответы и комментарии отрендерились до захвата.
Преодолейте анти-бот
Проверки бота и постраничные лимиты частоты каждого сайта обрабатываются автоматически. Ничего не нужно решать, ничего не нужно поддерживать.
Верните HTML или JSON
Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете stackexchange-serp или stackexchange-thread.
Что команды строят на данных Stack Exchange.
Майнинг знаний разработчиков
Извлекайте вопросы, принятые ответы и комментарии по всей сети, чтобы строить поисковые базы знаний.
Обучающие данные и RAG
Подавайте чистый текст вопрос-ответ в модели, RAG-пайплайны и кодовые агенты через один API.
Мониторинг техтрендов
Следите за тегами и страницами поиска по сайтам, чтобы рано замечать растущие языки, инструменты и темы.
Наборы данных Q&A
Собирайте структурированные наборы данных вопрос, ответ и голос для оценки и бенчмарков.
Конкурентные и dev-исследования
Анализируйте реальные вопросы, ошибки и обходные пути разработчиков, чтобы информировать продукт и документацию.
Любой URL, один API
Краульте вопросы, теги, страницы пользователей и поиск по сети, плюс любой другой сайт, который вам нужен.
Полезно знать при скрапинге Stack Exchange.
Одна пара скраперов, каждый сайт
stackexchange-serp и stackexchange-thread host-agnostic, поэтому эти два скрапера покрывают Stack Overflow, Super User, Ask Ubuntu, MathOverflow и все сообщества *.stackexchange.com.
HTML по умолчанию, JSON по запросу
Вы получаете полностью отрендеренный HTML. Добавьте scraper=stackexchange-serp или stackexchange-thread для распарсенного JSON или парсите HTML сами.
Резидентные прокси по замыслу
Stack Exchange ограничивает частоту запросов с датацентровых IP, поэтому запросы идут через резидентный пул. Каждый ротирует свежий IP, поэтому доступ остаётся стабильным.
Достигайте каждого сайта откуда угодно
Геотаргетинг по 30 регионам и 140M резидентных IP означает стабильный доступ без управления прокси.
Создано для краулинга Stack Exchange в масштабе.
Crawling API работает на той же сети, что обслуживает более 46 000 платящих клиентов и 70 000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно патчить, когда сайт Stack Exchange меняется.
Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99,99% под капотом.
Вопросы о скрапинге Stack Exchange.
Начните скрапить Stack Exchange.
Забудьте о прокси и лимитах частоты.
Бесплатно для старта с 20 000 запросов. Один токен для Crawling API и каждого скрапера.