Crawling API / GitHub

GitHub Scraper.
Любая страница, полностью отрендеренная.

Отправьте любой URL GitHub и получите обратно полностью отрендеренный HTML через резидентные прокси со встроенным обходом защиты от ботов.
Или извлеките структурированный JSON с помощью скраперов github-repository, github-serp и github-profile.

99% успешных запросов140M резидентных IP30 регионов
URL GitHubСтруктурированный JSONgithub.com/rails/railsCrawlbaseМаршрутРендерингРазборJSON репозиторияJSON поискаJSON профиляgithub-repositorygithub-serpgithub-profilegithub.com · rate limit rerouted · 200
Живой поток обхода · GitHub1.24M req/minПотоковая передача
200github.com/topics/machine-learningAU167ms
200github.com/search?q=llm+agents&type=repositoriesDE134ms
200github.com/facebook/reactES62ms
200github.com/rust-lang/rustIN156ms
200github.com/search?q=llm+agents&type=repositoriesSG136ms
200github.com/search?q=llm+agents&type=repositoriesDE205ms
200github.com/torvaldsNL89ms
200github.com/anthropics/anthropic-sdk-python/issuesSG211ms
200github.com/openai/openai-pythonIN121ms
200github.com/kubernetes/kubernetes/issuesDE189ms
200github.com/search?q=web+scraping&type=repositoriesIN83ms
200github.com/facebook/reactNL196ms
200github.com/golang/goIN98ms
200github.com/search?q=web+scraping&type=repositoriesFR58ms
200github.com/vercel/next.js/issuesGB188ms
200github.com/huggingfaceJP145ms
200github.com/openai/openai-pythonUS93ms
200github.com/golang/goBR131ms
200github.com/huggingfaceDE46ms
200github.com/topics/web-scrapingFR176ms
200github.com/torvalds/linuxUS155ms
301github.com/vercel/next.js/issuesUS108ms
200github.com/torvaldsSG173ms
200github.com/openai/openai-pythonAU161ms
200github.com/topics/web-scrapingNL43ms
200github.com/topics/machine-learningCA65ms
200github.com/topics/machine-learningAU167ms
200github.com/search?q=llm+agents&type=repositoriesDE134ms
200github.com/facebook/reactES62ms
200github.com/rust-lang/rustIN156ms
200github.com/search?q=llm+agents&type=repositoriesSG136ms
200github.com/search?q=llm+agents&type=repositoriesDE205ms
200github.com/torvaldsNL89ms
200github.com/anthropics/anthropic-sdk-python/issuesSG211ms
200github.com/openai/openai-pythonIN121ms
200github.com/kubernetes/kubernetes/issuesDE189ms
200github.com/search?q=web+scraping&type=repositoriesIN83ms
200github.com/facebook/reactNL196ms
200github.com/golang/goIN98ms
200github.com/search?q=web+scraping&type=repositoriesFR58ms
200github.com/vercel/next.js/issuesGB188ms
200github.com/huggingfaceJP145ms
200github.com/openai/openai-pythonUS93ms
200github.com/golang/goBR131ms
200github.com/huggingfaceDE46ms
200github.com/topics/web-scrapingFR176ms
200github.com/torvalds/linuxUS155ms
301github.com/vercel/next.js/issuesUS108ms
200github.com/torvaldsSG173ms
200github.com/openai/openai-pythonAU161ms
200github.com/topics/web-scrapingNL43ms
200github.com/topics/machine-learningCA65ms
01 Живое демо

Три скрапера GitHub, вживую.

Crawling API, набираемый вживую. Смотрите, как скраперы github-repository, github-serp и github-profile возвращают структурированный JSON. Наведите курсор, чтобы приостановить и прочитать.

готово
клавиши 1-3 переключают · нажмите для паузызапустите свой URL
Запустите первый запрос за считанные минуты. До 5,000 бесплатных запросов, без кредитной карты.Начать бесплатно
02 Возможности

Один API для всего, что GitHub бросает вам.

GitHub рендерит репозитории на стороне клиента и агрессивно ограничивает частоту запросов. Crawling API загружает полную страницу в настоящем браузере, обращается к ней через резидентные IP и отдает вам чистый HTML или JSON.

рендеринг

Полный рендеринг JavaScript

Настоящий браузер выполняет страницу, поэтому README, звезды, форки, языки и дерево файлов рендерятся и попадают в HTML, а не только исходную разметку.

прокси

140M резидентных IP

Каждый запрос ротирует резидентный IP по 30 регионам, поэтому вы обращаетесь к GitHub как реальный местный посетитель.

защита от ботов

Блокировки обрабатываются за вас

Ограничения частоты, проверки на ботов и страницы с испытаниями проходятся автоматически. Никаких персональных токенов доступа, ничего не нужно поддерживать.

формат

HTML или JSON

Получите полный отрендеренный HTML или добавьте scraper=github-repository, github-serp или github-profile, чтобы вернуть репозитории, результаты поиска и профили в виде структурированного JSON.

дополнительно

Скриншоты и асинхронность

Тот же вызов может сделать скриншот всей страницы или выполниться асинхронно с вебхуками и облачным хранилищем.

один токен

Один API для любого сайта

Crawling API работает с любым URL, поэтому один и тот же токен покрывает GitHub и все остальное, что вы обходите. Смотреть живое демо.

03 Вывод

Каждое поле репозитория в виде чистого JSON.

Отправьте URL репозитория с scraper=github-repository и репозиторий вернется в виде типизированного JSON. Используйте github-serp или github-profile, чтобы получить то же самое для результатов поиска и профилей.

{ "name": "rails", "fullName": "rails/rails", "url": "https://github.com/rails/rails", "description": "Ruby on Rails", "stars": 58789, "forks": 22414, "watchers": 3819, "primaryLanguage": "Ruby", "languages": [ "Ruby", "JavaScript", "HTML" ], "topics": [ "ruby", "rails", "framework" ], "openIssues": 612, "latestRelease": "v8.1.3", "defaultBranch": "main", "license": "MIT license", "archived": false }

Идентификация

name · string  fullName · string  url · string  description · string

Популярность

stars · number  forks · number  watchers · number

Стек

primaryLanguage · string  languages · array  topics · array

Активность

openIssues · number  latestRelease · string  defaultBranch · string

Мета

license · string  archived · boolean

04 Как это работает

От URL к данным за один вызов.

Каждый запрос к GitHub проходит по одному и тому же пути. Вы отправляете URL, мы управляем всем, что между.

01

Отправьте URL

Передайте любой публичный URL GitHub со своим токеном: репозиторий, задачу, профиль или поиск.

02

Ротация прокси

Резидентный IP и регион, которые чисто достигают GitHub, выбираются из 140M IP по 30 регионам.

03

Рендеринг страницы

Настоящий браузер загружает страницу репозитория, поэтому README, звезды, форки, языки и дерево файлов рендерятся до захвата.

04

Обход защиты от ботов

Ограничения частоты и проверки на ботов GitHub обрабатываются автоматически. Никаких токенов, ничего не нужно поддерживать.

05

Возврат HTML или JSON

Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете скрапер, например github-repository, github-serp или github-profile.

05 Сценарии использования

Что команды строят на данных GitHub.

USE / 01OSS

Аналитика open-source и разработчиков

Отслеживайте репозитории, звезды, форки, языки и релизы, чтобы составить карту ландшафта open-source и того, кто что создает.

USE / 02Тренды

Отслеживание зависимостей и трендов

Наблюдайте за темами, страницами поиска и активностью релизов, чтобы рано замечать растущие библиотеки, фреймворки и инструменты.

USE / 03Рекрутинг

Рекрутинг и dev-rel

Анализируйте публичные профили и вклады, чтобы находить мейнтейнеров, искать таланты и достигать нужных сообществ разработчиков.

USE / 04Обучение

Обучающие данные для кодовых моделей

Подавайте чистый текст README и страниц в модели, RAG-пайплайны и кодовые агенты через один API.

USE / 05Безопасность

Исследование безопасности и цепочки поставок

Отслеживайте публичные репозитории, задачи и зависимости, чтобы изучать пакеты и риски цепочки поставок.

USE / 06Охват

Любой URL, один API

Обходите репозитории, задачи, профили, темы и поиск, а также любой другой нужный вам сайт.

06 Примечания

Что полезно знать при сборе данных с GitHub.

Рендеринг как в настоящем браузере

GitHub рендерит репозитории на стороне клиента; Crawling API запускает настоящий браузер, поэтому README, звезды, форки, языки и дерево файлов загружаются до захвата.

HTML по умолчанию, JSON по запросу

Вы получаете полный отрендеренный HTML. Добавьте scraper=github-repository, github-serp или github-profile для разобранного JSON или разберите HTML самостоятельно.

Никаких токенов GitHub или лимитов API

Вы указываете на публичную веб-страницу, поэтому нет персональных токенов доступа для ротации и нет ограничений частоты REST API, которые нужно учитывать.

Только публичные репозитории и профили

Crawling API читает публично видимые страницы без входа в систему, поэтому вы получаете то, что видит незалогиненный посетитель.

07 Почему Crawlbase

Создан для обхода GitHub в масштабе.

Crawling API работает в той же сети, которая обслуживает более 46,000 платящих клиентов и более 70,000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно чинить, когда GitHub меняется.

99%
Средний процент успешных запросов
140M
Резидентных IP, плюс 98M дата-центров
30
Регионов для точных локальных результатов
20/s
Запросов в секунду по умолчанию, больше по запросу

Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99.99% под капотом.

08 FAQ

Вопросы о сборе данных с GitHub.

Отправьте URL GitHub в Crawlbase Crawling API со своим токеном. Crawlbase ротирует резидентный прокси, рендерит страницу в настоящем браузере, проходит проверки на ботов и возвращает полностью отрендеренный HTML. Добавьте специализированный скрапер (scraper=github-repository, github-serp или github-profile), чтобы вместо этого получить структурированный JSON.
Да. По умолчанию Crawling API возвращает отрендеренный HTML; добавьте специализированный скрапер GitHub (scraper=github-repository для репозиториев, github-serp для поиска, github-profile для профилей), чтобы получить структурированный JSON, или разберите HTML самостоятельно.
Нет. Вы направляете Crawling API на публичную веб-страницу, поэтому нет персональных токенов доступа для выпуска или ротации и нет ограничений частоты REST API, которые нужно учитывать. Crawlbase обращается к GitHub за вас.
Crawlbase маршрутизирует каждый запрос через ротируемые резидентные IP по 30 регионам и автоматически проходит проверки на ботов. Вы не управляете прокси и не жонглируете токенами, и нечего поддерживать, когда GitHub меняет свою настройку.
Да. Настоящий браузер загружает страницу репозитория, поэтому отрендеренные README, звезды, форки, языки и дерево файлов присутствуют в HTML, а не только исходная разметка.
Любой публичный URL: репозитории, задачи и пул-реквесты, профили пользователей и организаций, страницы тем и результаты поиска. Тот же API работает и с любым другим сайтом.
Начните бесплатно, до 5,000 запросов и без кредитной карты. Платные планы масштабируются с использованием, и тот же токен работает в Crawling API и каждом scraper Crawlbase.

Начните собирать данные с GitHub.
Забудьте про токены и ограничения частоты.

Бесплатное начало, до 5,000 запросов. Один токен для Crawling API и каждого scraper.