Crawling API / GitHub

GitHub Scraper.
Любая страница, полностью отрендеренная.

Отправьте любой URL GitHub и получите обратно полностью отрендеренный HTML через резидентные прокси со встроенным обходом защиты от ботов.
Или извлеките структурированный JSON с помощью скраперов github-repository, github-serp и github-profile.

99% успешных запросов140M резидентных IP30 регионов
URL GitHubСтруктурированный JSONgithub.com/rails/railsCrawlbaseМаршрутРендерингРазборJSON репозиторияJSON поискаJSON профиляgithub-repositorygithub-serpgithub-profilegithub.com · rate limit rerouted · 200
Живой поток обхода · GitHub1.24M req/minПотоковая передача
200github.com/search?q=llm+agents&type=repositoriesJP57ms
200github.com/search?q=web+scraping&type=repositoriesUS71ms
200github.com/anthropics/anthropic-sdk-pythonSG200ms
200github.com/huggingfaceCA177ms
200github.com/search?q=web+scraping&type=repositoriesCA143ms
200github.com/openai/openai-pythonBR95ms
200github.com/kubernetes/kubernetes/issuesIN63ms
200github.com/vercel/next.js/issuesAU152ms
404github.com/microsoftFR80ms
200github.com/search?q=web+scraping&type=repositoriesDE102ms
200github.com/huggingfaceJP66ms
200github.com/golang/goDE172ms
200github.com/torvaldsFR185ms
200github.com/search?q=web+scraping&type=repositoriesNL158ms
200github.com/torvaldsDE137ms
200github.com/anthropics/anthropic-sdk-pythonCA151ms
200github.com/search?q=web+scraping&type=repositoriesUS126ms
200github.com/topics/machine-learningCA209ms
200github.com/anthropics/anthropic-sdk-python/issuesSG217ms
200github.com/torvalds/linuxGB199ms
200github.com/anthropics/anthropic-sdk-pythonSG123ms
200github.com/torvaldsIN43ms
200github.com/search?q=llm+agents&type=repositoriesBR177ms
200github.com/anthropics/anthropic-sdk-pythonUS115ms
200github.com/golang/goUS84ms
200github.com/anthropics/anthropic-sdk-python/issuesBR44ms
200github.com/search?q=llm+agents&type=repositoriesJP57ms
200github.com/search?q=web+scraping&type=repositoriesUS71ms
200github.com/anthropics/anthropic-sdk-pythonSG200ms
200github.com/huggingfaceCA177ms
200github.com/search?q=web+scraping&type=repositoriesCA143ms
200github.com/openai/openai-pythonBR95ms
200github.com/kubernetes/kubernetes/issuesIN63ms
200github.com/vercel/next.js/issuesAU152ms
404github.com/microsoftFR80ms
200github.com/search?q=web+scraping&type=repositoriesDE102ms
200github.com/huggingfaceJP66ms
200github.com/golang/goDE172ms
200github.com/torvaldsFR185ms
200github.com/search?q=web+scraping&type=repositoriesNL158ms
200github.com/torvaldsDE137ms
200github.com/anthropics/anthropic-sdk-pythonCA151ms
200github.com/search?q=web+scraping&type=repositoriesUS126ms
200github.com/topics/machine-learningCA209ms
200github.com/anthropics/anthropic-sdk-python/issuesSG217ms
200github.com/torvalds/linuxGB199ms
200github.com/anthropics/anthropic-sdk-pythonSG123ms
200github.com/torvaldsIN43ms
200github.com/search?q=llm+agents&type=repositoriesBR177ms
200github.com/anthropics/anthropic-sdk-pythonUS115ms
200github.com/golang/goUS84ms
200github.com/anthropics/anthropic-sdk-python/issuesBR44ms
01 Живое демо

Три скрапера GitHub, вживую.

Crawling API, набираемый вживую. Смотрите, как скраперы github-repository, github-serp и github-profile возвращают структурированный JSON. Наведите курсор, чтобы приостановить и прочитать.

готово
клавиши 1-3 переключают · нажмите для паузызапустите свой URL
Запустите первый запрос за считанные минуты. До 20,000 бесплатных запросов, без кредитной карты.Начать бесплатно
02 Возможности

Один API для всего, что GitHub бросает вам.

GitHub рендерит репозитории на стороне клиента и агрессивно ограничивает частоту запросов. Crawling API загружает полную страницу в настоящем браузере, обращается к ней через резидентные IP и отдает вам чистый HTML или JSON.

рендеринг

Полный рендеринг JavaScript

Настоящий браузер выполняет страницу, поэтому README, звезды, форки, языки и дерево файлов рендерятся и попадают в HTML, а не только исходную разметку.

прокси

140M резидентных IP

Каждый запрос ротирует резидентный IP по 30 регионам, поэтому вы обращаетесь к GitHub как реальный местный посетитель.

защита от ботов

Блокировки обрабатываются за вас

Ограничения частоты, проверки на ботов и страницы с испытаниями проходятся автоматически. Никаких персональных токенов доступа, ничего не нужно поддерживать.

формат

HTML или JSON

Получите полный отрендеренный HTML или добавьте scraper=github-repository, github-serp или github-profile, чтобы вернуть репозитории, результаты поиска и профили в виде структурированного JSON.

дополнительно

Скриншоты и асинхронность

Тот же вызов может сделать скриншот всей страницы или выполниться асинхронно с вебхуками и облачным хранилищем.

один токен

Один API для любого сайта

Crawling API работает с любым URL, поэтому один и тот же токен покрывает GitHub и все остальное, что вы обходите. Смотреть живое демо.

03 Вывод

Каждое поле репозитория в виде чистого JSON.

Отправьте URL репозитория с scraper=github-repository и репозиторий вернется в виде типизированного JSON. Используйте github-serp или github-profile, чтобы получить то же самое для результатов поиска и профилей.

{ "name": "rails", "fullName": "rails/rails", "url": "https://github.com/rails/rails", "description": "Ruby on Rails", "stars": 58789, "forks": 22414, "watchers": 3819, "primaryLanguage": "Ruby", "languages": [ "Ruby", "JavaScript", "HTML" ], "topics": [ "ruby", "rails", "framework" ], "openIssues": 612, "latestRelease": "v8.1.3", "defaultBranch": "main", "license": "MIT license", "archived": false }

Идентификация

name · string  fullName · string  url · string  description · string

Популярность

stars · number  forks · number  watchers · number

Стек

primaryLanguage · string  languages · array  topics · array

Активность

openIssues · number  latestRelease · string  defaultBranch · string

Мета

license · string  archived · boolean

04 Как это работает

От URL к данным за один вызов.

Каждый запрос к GitHub проходит по одному и тому же пути. Вы отправляете URL, мы управляем всем, что между.

01

Отправьте URL

Передайте любой публичный URL GitHub со своим токеном: репозиторий, задачу, профиль или поиск.

02

Ротация прокси

Резидентный IP и регион, которые чисто достигают GitHub, выбираются из 140M IP по 30 регионам.

03

Рендеринг страницы

Настоящий браузер загружает страницу репозитория, поэтому README, звезды, форки, языки и дерево файлов рендерятся до захвата.

04

Обход защиты от ботов

Ограничения частоты и проверки на ботов GitHub обрабатываются автоматически. Никаких токенов, ничего не нужно поддерживать.

05

Возврат HTML или JSON

Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете скрапер, например github-repository, github-serp или github-profile.

05 Сценарии использования

Что команды строят на данных GitHub.

USE / 01OSS

Аналитика open-source и разработчиков

Отслеживайте репозитории, звезды, форки, языки и релизы, чтобы составить карту ландшафта open-source и того, кто что создает.

USE / 02Тренды

Отслеживание зависимостей и трендов

Наблюдайте за темами, страницами поиска и активностью релизов, чтобы рано замечать растущие библиотеки, фреймворки и инструменты.

USE / 03Рекрутинг

Рекрутинг и dev-rel

Анализируйте публичные профили и вклады, чтобы находить мейнтейнеров, искать таланты и достигать нужных сообществ разработчиков.

USE / 04Обучение

Обучающие данные для кодовых моделей

Подавайте чистый текст README и страниц в модели, RAG-пайплайны и кодовые агенты через один API.

USE / 05Безопасность

Исследование безопасности и цепочки поставок

Отслеживайте публичные репозитории, задачи и зависимости, чтобы изучать пакеты и риски цепочки поставок.

USE / 06Охват

Любой URL, один API

Обходите репозитории, задачи, профили, темы и поиск, а также любой другой нужный вам сайт.

06 Примечания

Что полезно знать при сборе данных с GitHub.

Рендеринг как в настоящем браузере

GitHub рендерит репозитории на стороне клиента; Crawling API запускает настоящий браузер, поэтому README, звезды, форки, языки и дерево файлов загружаются до захвата.

HTML по умолчанию, JSON по запросу

Вы получаете полный отрендеренный HTML. Добавьте scraper=github-repository, github-serp или github-profile для разобранного JSON или разберите HTML самостоятельно.

Никаких токенов GitHub или лимитов API

Вы указываете на публичную веб-страницу, поэтому нет персональных токенов доступа для ротации и нет ограничений частоты REST API, которые нужно учитывать.

Только публичные репозитории и профили

Crawling API читает публично видимые страницы без входа в систему, поэтому вы получаете то, что видит незалогиненный посетитель.

07 Почему Crawlbase

Создан для обхода GitHub в масштабе.

Crawling API работает в той же сети, которая обслуживает более 46,000 платящих клиентов и более 70,000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно чинить, когда GitHub меняется.

99%
Средний процент успешных запросов
140M
Резидентных IP, плюс 98M дата-центров
30
Регионов для точных локальных результатов
20/s
Запросов в секунду по умолчанию, больше по запросу

Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99.99% под капотом.

08 FAQ

Вопросы о сборе данных с GitHub.

Отправьте URL GitHub в Crawlbase Crawling API со своим токеном. Crawlbase ротирует резидентный прокси, рендерит страницу в настоящем браузере, проходит проверки на ботов и возвращает полностью отрендеренный HTML. Добавьте специализированный скрапер (scraper=github-repository, github-serp или github-profile), чтобы вместо этого получить структурированный JSON.
Да. По умолчанию Crawling API возвращает отрендеренный HTML; добавьте специализированный скрапер GitHub (scraper=github-repository для репозиториев, github-serp для поиска, github-profile для профилей), чтобы получить структурированный JSON, или разберите HTML самостоятельно.
Нет. Вы направляете Crawling API на публичную веб-страницу, поэтому нет персональных токенов доступа для выпуска или ротации и нет ограничений частоты REST API, которые нужно учитывать. Crawlbase обращается к GitHub за вас.
Crawlbase маршрутизирует каждый запрос через ротируемые резидентные IP по 30 регионам и автоматически проходит проверки на ботов. Вы не управляете прокси и не жонглируете токенами, и нечего поддерживать, когда GitHub меняет свою настройку.
Да. Настоящий браузер загружает страницу репозитория, поэтому отрендеренные README, звезды, форки, языки и дерево файлов присутствуют в HTML, а не только исходная разметка.
Любой публичный URL: репозитории, задачи и пул-реквесты, профили пользователей и организаций, страницы тем и результаты поиска. Тот же API работает и с любым другим сайтом.
Начните бесплатно, до 20,000 запросов и без кредитной карты. Платные планы масштабируются с использованием, и тот же токен работает в Crawling API и каждом scraper Crawlbase.

Начните собирать данные с GitHub.
Забудьте про токены и ограничения частоты.

Бесплатное начало, до 20,000 запросов. Один токен для Crawling API и каждого scraper.