Scribd Scraper.
Любая страница, полностью отрендеренная.
Отправьте любой URL Scribd и получите обратно полностью отрендеренный HTML, через резидентные прокси со встроенной обработкой анти-бот защиты.
Превратите его в JSON с помощью generic extractor.
Любой URL Scribd на входе. HTML или JSON на выходе.
Crawling API, набранный вживую. Получите отрендеренный HTML или переключитесь на generic extractor для JSON. Наведите курсор, чтобы приостановить и прочитать.
Один API для всего, что подкидывает Scribd.
Ридер документов Scribd рендерится через JavaScript с лениво загружаемыми страницами, ограничением предпросмотра и метаданными, которые загружаются с задержкой, и он агрессивно блокирует. Crawling API рендерит его в реальном браузере, обращается к нему через резидентные IP и выдаёт вам чистый HTML или JSON.
Полный рендеринг JavaScript
Реальный браузер выполняет страницу, поэтому ридер документов, лениво загружаемые страницы, текст предпросмотра и динамически загружаемые метаданные захватываются полностью, а не только исходный HTML.
140M резидентных IP
Каждый запрос ротирует резидентный IP по 30 географиям, поэтому вы обращаетесь к Scribd как настоящий местный посетитель.
Блокировки обрабатываются за вас
CAPTCHA, бот-стены и ограничения частоты снимаются автоматически. Ничего решать, ничего поддерживать.
HTML или JSON
Получите полный отрендеренный HTML или добавьте scraper=generic-extractor чтобы вернуть заголовок, содержимое, изображения и ссылки в виде структурированного JSON.
Скриншоты и асинхронность
Тот же вызов может сделать полностраничный скриншот или выполниться асинхронно с вебхуками и облачным хранилищем.
Один API для любого сайта
Crawling API работает с любым URL, поэтому один и тот же токен покрывает Scribd и всё остальное, что вы краулите. Посмотреть живое демо.
Отрендеренный HTML или чистый JSON.
По умолчанию вы получаете отрендеренный HTML. Добавьте generic-extractor и та же страница вернётся в виде типизированного JSON.
Страница
title · string canonical · string favicon · string
Мета
meta.description · string meta.keywords · string
Содержимое
content · string
Медиа
images · array og_images · array
Ссылки
links · array
От URL к данным за один вызов.
Каждый запрос к Scribd проходит одним и тем же путём. Вы отправляете URL, мы управляем всем, что между.
Отправьте URL
Передайте любой публичный URL Scribd со своим токеном: документ, книгу, аудиокнигу, презентацию, профиль или поиск.
Ротируйте прокси
Резидентный IP и география, которые обращаются к Scribd чисто, выбранные из 140M IP по 30 регионам.
Отрендерите страницу
Реальный браузер загружает страницу, поэтому ридер документов, лениво загружаемые страницы и динамически загружаемые метаданные рендерятся до захвата.
Снимите анти-бот защиту
Агрессивные бот-проверки и ограничения частоты Scribd обрабатываются автоматически. Ничего решать, ничего поддерживать.
Верните HTML или JSON
Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете generic extractor.
Что команды строят на данных Scribd.
Каталог документов и обнаружение
Извлекайте заголовки, авторов, категории и количество страниц по документам, чтобы строить каталоги с поиском.
Сбор метаданных и предпросмотра
Захватывайте читаемый текст предпросмотра и метаданные документа, которые ридер загружает динамически.
Обучающие данные и RAG
Подавайте чистый текст документов и предпросмотры в модели, RAG-конвейеры и агентов через один API.
Мониторинг авторов и загрузок
Отслеживайте новые загрузки, книги, аудиокниги и презентации по профилям и категориям.
Рыночные и контентные исследования
Собирайте реальные заголовки документов, описания и темы, чтобы информировать продуктовые и контентные решения.
Любой URL, один API
Краульте документы, книги, аудиокниги, презентации, профили и поиск, а также любой другой сайт, который вам нужен.
Полезно знать при извлечении данных Scribd.
Отрендерено как в реальном браузере
Scribd это ридер документов с рендерингом через JavaScript и лениво загружаемыми страницами; Crawling API запускает реальный браузер, поэтому текст предпросмотра и метаданные загружаются до захвата.
HTML по умолчанию, JSON по запросу
Вы получаете полный отрендеренный HTML. Добавьте scraper=generic-extractor для разобранных заголовка, содержимого, изображений и ссылок, или разберите HTML самостоятельно.
Только публичные страницы
Crawling API читает публично видимые страницы, без входа в систему, поэтому вы получаете заголовок, автора, количество страниц, категорию и читаемый предпросмотр, которые видит вышедший из системы посетитель.
Обращайтесь к Scribd откуда угодно
Геотаргетинг по 30 регионам и 140M резидентных IP означает стабильный доступ без управления прокси.
Создано для краулинга Scribd в масштабе.
Crawling API работает в той же сети, которая обслуживает 46,000+ платящих клиентов и 70,000+ разработчиков. Не нужно покупать прокси, запускать браузеры, ничего латать, когда Scribd меняется.
Один токен, официальные SDK для Python, Node и Ruby, и сеть с аптаймом 99.99% под капотом.
Вопросы об извлечении данных Scribd.
Начните извлекать данные Scribd.
Пропустите прокси и блокировки.
Бесплатный старт, до 20,000 запросов. Один токен для Crawling API и каждого скрапера.