Скрапер Kaggle.
Датасеты и ноутбуки, полностью отрендеренные.
Отправьте любой URL Kaggle и получите обратно полностью отрендеренный HTML через резидентные прокси со встроенной обработкой анти-бот-защиты.
Или получите структурированный JSON со скраперами kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp и kaggle-notebook.
Четыре скрапера Kaggle. Чистый JSON от каждого.
Четыре скрапера Kaggle, вводятся вживую. kaggle-dataset-serp читает страницу поиска датасетов, kaggle-dataset берёт один датасет с его файлами и лицензией, kaggle-notebook-serp читает список ноутбуков, а kaggle-notebook возвращает один ноутбук с его статистикой и входными данными. Переключайте вкладки или наведите, чтобы приостановить и прочитать.
Один API, каждый уголок Kaggle.
Четыре специализированных скрапера покрывают важные страницы: поиск датасетов, отдельные датасеты, поиск ноутбуков и отдельные ноутбуки. Crawling API рендерит каждую страницу в реальном браузере, достигает её через резидентные IP и выдаёт вам чистый HTML или JSON.
Каждый список датасетов
kaggle-dataset-serp превращает страницу поиска датасетов в JSON: totalCount, page и hasNextPage, плюс каждая карточка с её позицией, заголовком, slug, владельцем, рейтингом удобства, числом и форматом файлов, размером, загрузками, числом ноутбуков, голосами и медалью.
Полные метаданные датасета
kaggle-dataset возвращает один датасет с его заголовком, подзаголовком, описанием в Markdown, версией, ключевыми словами, владельцем, лицензией, списком файлов с форматами и размерами в байтах, а также счётчиками загрузок, просмотров, голосов и комментариев.
Списки ноутбуков
kaggle-notebook-serp возвращает страницу поиска ноутбуков, каждая строка с её позицией, заголовком, slug, автором и соавторами, последним обновлением, числом комментариев, контекстом соревнования или датасета, голосами и медалью.
Отдельные ноутбуки
Добавьте scraper=kaggle-notebook чтобы вернуть один ноутбук с его автором, языком, средой выполнения, историей версий, просмотрами, голосами, копиями, комментариями, медалью, лицензией и входными данными.
140M резидентных IP
Каждый запрос ротирует резидентный IP по 30 регионам и преодолевает проверки бота автоматически. Ничего не нужно решать, ничего не нужно поддерживать.
Один API для каждой страницы
Crawling API работает с любым URL, поэтому один и тот же токен покрывает каждый датасет и ноутбук Kaggle и всё остальное, что вы краулите. Смотреть живое демо.
Каждое поле датасета как чистый JSON.
Отправьте URL датасета с scraper=kaggle-dataset и датасет возвращается типизированным JSON, включая файлы и лицензию. Замените на kaggle-dataset-serp, kaggle-notebook-serp или kaggle-notebook для списков и ноутбуков.
Датасет
url · string id · string title · string subtitle · string
Владелец и лицензия
owner.name · string owner.url · string license.name · string license.url · string
Файлы
files[].format · string files[].sizeBytes · number files[].downloadUrl · string files[].requiresSubscription · boolean
Вовлечённость
downloads · number views · number votes · number commentCount · number
Метаданные
description · string keywords · array lastUpdated · string isAccessibleForFree · boolean
От URL до данных за один вызов.
Каждый запрос к Kaggle проходит один и тот же путь. Вы отправляете URL, мы управляем всем остальным.
Отправьте URL
Передайте любой публичный URL Kaggle с вашим токеном: страницу поиска датасетов, датасет, список ноутбуков или отдельный ноутбук.
Ротируйте прокси
Резидентный IP и регион, которые чисто достигают сайта, из 140M IP по 30 регионам.
Отрендерьте страницу
Реальный браузер загружает страницу, чтобы результаты поиска, карточки датасетов и боковые панели ноутбуков отрендерились до захвата.
Преодолейте анти-бот
Проверки бота и лимиты частоты сайта обрабатываются автоматически. Ничего не нужно решать, ничего не нужно поддерживать.
Верните HTML или JSON
Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp или kaggle-notebook.
Что команды строят на данных Kaggle.
Обнаружение датасетов
Проходите страницы поиска датасетов по ключевому слову и странице, чтобы построить поисковый индекс того, что существует, кому оно принадлежит и как лицензировано.
Синхронизация каталога данных
Зеркальте заголовки, подзаголовки, описания, ключевые слова, версии, форматы файлов и размеры в байтах во внутренний каталог и поддерживайте его актуальным.
Проверки лицензий и доступа
Читайте название и URL лицензии, isAccessibleForFree и пофайловый флаг requiresSubscription до того, как датасет попадёт в пайплайн.
Исследование ноутбуков и методов
Собирайте списки ноутбуков и отдельные ноутбуки, чтобы увидеть, с какими языками, средами выполнения и контекстами соревнований сообщество реально работает.
Отслеживание популярности
Отслеживайте загрузки, просмотры, голоса, копии и число комментариев во времени, чтобы видеть, какие датасеты и ноутбуки набирают популярность.
Любой URL, один API
Краульте поиск датасетов, датасеты, поиск ноутбуков и отдельные ноутбуки, плюс любой другой сайт, который вам нужен.
Полезно знать при скрапинге Kaggle.
HTML по умолчанию, JSON по запросу
Вы получаете полностью отрендеренный HTML. Добавьте scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp или kaggle-notebook для распарсенного JSON или парсите HTML сами.
Списки ноутбуков отдают метку, а не число
Kaggle рендерит в списке ноутбуков только Results (100+), поэтому totalCountLabel возвращается этой строкой дословно, а не выдуманным числом. Список датасетов при этом отдаёт реальный числовой totalCount.
Тела ноутбуков живут в iframe
Выполненный ноутбук отдаётся с отдельного origin внутри iframe, поэтому он не является частью документа страницы. contentUrl адресует этот фрейм и несёт недолговечный подписанный токен, так что запрашивайте его вскоре после краулинга.
Статистика списков приходит как отображается
В карточке датасета size - это строка, которую Kaggle показывает с единицами, например 6 kB, а сокращённое число загрузок разворачивается обратно в целое число, поэтому 362K возвращается как 362000.
Создано для краулинга Kaggle в масштабе.
Crawling API работает на той же сети, что обслуживает более 46 000 платящих клиентов и 70 000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно патчить, когда сайт меняется.
Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99,99% под капотом.
Вопросы о скрапинге Kaggle.
Начните скрапить Kaggle.
Забудьте о прокси и лимитах частоты.
Бесплатно для старта с 20 000 запросов. Один токен для Crawling API и каждого скрапера.