Скрапер Duolingo.
Любая страница, полностью отрендеренная.
Отправьте любой URL Duolingo и получите обратно полностью отрендеренный HTML через резидентные прокси со встроенным обходом защиты от ботов.
Превратите его в JSON с помощью generic extractor.
Любой URL Duolingo на входе. HTML или JSON на выходе.
Crawling API, набранный вживую. Получите отрендеренный HTML или переключитесь на generic extractor для JSON. Наведите курсор, чтобы приостановить и прочитать.
Один API для всего, что подкидывает Duolingo.
Duolingo, это одностраничное JavaScript-приложение, где деревья курсов, таблицы лидеров и профили рендерятся через внутренние API, с обнаружением ботов на страницах приложения и профиля. Crawling API рендерит его в настоящем браузере, обращается к нему через резидентные IP и отдаёт вам чистый HTML или JSON.
Полный рендеринг JavaScript
Настоящий браузер выполняет одностраничное приложение, поэтому разделы курсов, уроки, таблицы лидеров и данные профилей, загружаемые через внутренние API, захватываются целиком, а не только исходная оболочка.
140M резидентных IP
Каждый запрос ротирует резидентный IP в 30 регионах, поэтому вы обращаетесь к Duolingo как настоящий местный ученик.
Блокировки обрабатываются за вас
CAPTCHA, бот-стены и лимиты запросов снимаются автоматически. Ничего решать, ничего поддерживать.
HTML или JSON
Получите полный отрендеренный HTML или добавьте scraper=generic-extractor, чтобы вернуть заголовок, контент, изображения и ссылки в виде структурированного JSON.
Скриншоты и асинхронность
Тот же вызов может сделать полностраничный скриншот или выполниться асинхронно с вебхуками и облачным хранилищем.
Один API для любого сайта
Crawling API работает с любым URL, поэтому один и тот же токен покрывает Duolingo и всё остальное, что вы краулите. Посмотрите живое демо.
Отрендеренный HTML или чистый JSON.
По умолчанию вы получаете отрендеренный HTML. Добавьте generic-extractor, и та же страница вернётся в виде типизированного JSON.
Страница
title · string canonical · string favicon · string
Мета
meta.description · string meta.keywords · string
Контент
content · string
Медиа
images · array og_images · array
Ссылки
links · array
От URL до данных за один вызов.
Каждый запрос к Duolingo проходит одним и тем же путём. Вы отправляете URL, мы обеспечиваем всё остальное между.
Отправьте URL
Передайте любой публичный URL Duolingo со своим токеном: курс, каталог, таблицу лидеров или публичный профиль.
Ротация прокси
Резидентный IP и регион, которые чисто достигают Duolingo, выбираемые из 140M IP в 30 регионах.
Рендеринг страницы
Настоящий браузер загружает одностраничное приложение, чтобы разделы курсов, таблицы лидеров и данные профилей отрендерились перед захватом.
Обход защиты от ботов
Проверки Duolingo на ботов на страницах приложения и профиля обрабатываются автоматически. Ничего решать, ничего поддерживать.
Вернуть HTML или JSON
Возвращается полностью отрендеренный HTML или типизированный JSON, когда вы добавляете generic extractor.
Что команды строят на данных Duolingo.
Мониторинг курсов и контента
Отслеживайте разделы курсов, уроки и изменения каталога по языковым парам по мере того, как Duolingo их обновляет.
Данные для изучения языков
Собирайте содержание курсов, задания упражнений и локализованные строки, чтобы изучать, как устроены уроки.
Конкурентный анализ
Сравнивайте охват курсов, функции и таблицы лидеров с другими приложениями для изучения языков.
Исследование локализации
Сравнивайте один и тот же курс между исходным и целевым языками, чтобы направлять работу по переводу и локализации.
Обучающие данные и RAG
Подавайте чистый текст Duolingo в модели, RAG-конвейеры и агентов через один API.
Любой URL, один API
Краульте курсы, каталог, таблицы лидеров и профили, плюс любой другой нужный вам сайт.
Что полезно знать при скрапинге Duolingo.
Рендеринг как в настоящем браузере
Duolingo, это одностраничное приложение; Crawling API запускает настоящий браузер, поэтому деревья курсов, таблицы лидеров и данные профилей загружаются через их внутренние API перед захватом.
HTML по умолчанию, JSON по запросу
Вы получаете полный отрендеренный HTML. Добавьте scraper=generic-extractor для распарсенных заголовка, контента, изображений и ссылок или парсите HTML самостоятельно.
Языковые пары живут в пути
URL курса несёт исходный и целевой языки, поэтому вы можете нацелиться на конкретную пару и геотаргетировать запрос для локализованного контента.
Доступ к Duolingo откуда угодно
Геотаргетинг по 30 регионам и 140M резидентных IP означает стабильный доступ без управления прокси.
Создан для краулинга Duolingo в масштабе.
Crawling API работает в той же сети, которая обслуживает более 46,000 платящих клиентов и более 70,000 разработчиков. Никаких прокси для покупки, никаких браузеров для запуска, нечего латать, когда Duolingo меняется.
Один токен, официальные SDK для Python, Node и Ruby, и сеть с аптаймом 99.99% под капотом.
Вопросы о скрапинге Duolingo.
Начните скрапить Duolingo.
Забудьте про прокси и блокировки.
Бесплатно на старте, до 20,000 запросов. Один токен для Crawling API и каждого скрапера.