GitHub Scraper.
Любая страница, полностью отрендеренная.
Отправьте любой URL GitHub и получите обратно полностью отрендеренный HTML через резидентные прокси со встроенным обходом защиты от ботов.
Или извлеките структурированный JSON с помощью скраперов github-repository, github-serp и github-profile.
Три скрапера GitHub, вживую.
Crawling API, набираемый вживую. Смотрите, как скраперы github-repository, github-serp и github-profile возвращают структурированный JSON. Наведите курсор, чтобы приостановить и прочитать.
Один API для всего, что GitHub бросает вам.
GitHub рендерит репозитории на стороне клиента и агрессивно ограничивает частоту запросов. Crawling API загружает полную страницу в настоящем браузере, обращается к ней через резидентные IP и отдает вам чистый HTML или JSON.
Полный рендеринг JavaScript
Настоящий браузер выполняет страницу, поэтому README, звезды, форки, языки и дерево файлов рендерятся и попадают в HTML, а не только исходную разметку.
140M резидентных IP
Каждый запрос ротирует резидентный IP по 30 регионам, поэтому вы обращаетесь к GitHub как реальный местный посетитель.
Блокировки обрабатываются за вас
Ограничения частоты, проверки на ботов и страницы с испытаниями проходятся автоматически. Никаких персональных токенов доступа, ничего не нужно поддерживать.
HTML или JSON
Получите полный отрендеренный HTML или добавьте scraper=github-repository, github-serp или github-profile, чтобы вернуть репозитории, результаты поиска и профили в виде структурированного JSON.
Скриншоты и асинхронность
Тот же вызов может сделать скриншот всей страницы или выполниться асинхронно с вебхуками и облачным хранилищем.
Один API для любого сайта
Crawling API работает с любым URL, поэтому один и тот же токен покрывает GitHub и все остальное, что вы обходите. Смотреть живое демо.
Каждое поле репозитория в виде чистого JSON.
Отправьте URL репозитория с scraper=github-repository и репозиторий вернется в виде типизированного JSON. Используйте github-serp или github-profile, чтобы получить то же самое для результатов поиска и профилей.
Идентификация
name · string fullName · string url · string description · string
Популярность
stars · number forks · number watchers · number
Стек
primaryLanguage · string languages · array topics · array
Активность
openIssues · number latestRelease · string defaultBranch · string
Мета
license · string archived · boolean
От URL к данным за один вызов.
Каждый запрос к GitHub проходит по одному и тому же пути. Вы отправляете URL, мы управляем всем, что между.
Отправьте URL
Передайте любой публичный URL GitHub со своим токеном: репозиторий, задачу, профиль или поиск.
Ротация прокси
Резидентный IP и регион, которые чисто достигают GitHub, выбираются из 140M IP по 30 регионам.
Рендеринг страницы
Настоящий браузер загружает страницу репозитория, поэтому README, звезды, форки, языки и дерево файлов рендерятся до захвата.
Обход защиты от ботов
Ограничения частоты и проверки на ботов GitHub обрабатываются автоматически. Никаких токенов, ничего не нужно поддерживать.
Возврат HTML или JSON
Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете скрапер, например github-repository, github-serp или github-profile.
Что команды строят на данных GitHub.
Аналитика open-source и разработчиков
Отслеживайте репозитории, звезды, форки, языки и релизы, чтобы составить карту ландшафта open-source и того, кто что создает.
Отслеживание зависимостей и трендов
Наблюдайте за темами, страницами поиска и активностью релизов, чтобы рано замечать растущие библиотеки, фреймворки и инструменты.
Рекрутинг и dev-rel
Анализируйте публичные профили и вклады, чтобы находить мейнтейнеров, искать таланты и достигать нужных сообществ разработчиков.
Обучающие данные для кодовых моделей
Подавайте чистый текст README и страниц в модели, RAG-пайплайны и кодовые агенты через один API.
Исследование безопасности и цепочки поставок
Отслеживайте публичные репозитории, задачи и зависимости, чтобы изучать пакеты и риски цепочки поставок.
Любой URL, один API
Обходите репозитории, задачи, профили, темы и поиск, а также любой другой нужный вам сайт.
Что полезно знать при сборе данных с GitHub.
Рендеринг как в настоящем браузере
GitHub рендерит репозитории на стороне клиента; Crawling API запускает настоящий браузер, поэтому README, звезды, форки, языки и дерево файлов загружаются до захвата.
HTML по умолчанию, JSON по запросу
Вы получаете полный отрендеренный HTML. Добавьте scraper=github-repository, github-serp или github-profile для разобранного JSON или разберите HTML самостоятельно.
Никаких токенов GitHub или лимитов API
Вы указываете на публичную веб-страницу, поэтому нет персональных токенов доступа для ротации и нет ограничений частоты REST API, которые нужно учитывать.
Только публичные репозитории и профили
Crawling API читает публично видимые страницы без входа в систему, поэтому вы получаете то, что видит незалогиненный посетитель.
Создан для обхода GitHub в масштабе.
Crawling API работает в той же сети, которая обслуживает более 46,000 платящих клиентов и более 70,000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, ничего не нужно чинить, когда GitHub меняется.
Один токен, официальные SDK для Python, Node и Ruby и сеть с аптаймом 99.99% под капотом.
Вопросы о сборе данных с GitHub.
Начните собирать данные с GitHub.
Забудьте про токены и ограничения частоты.
Бесплатное начало, до 20,000 запросов. Один токен для Crawling API и каждого scraper.