Скрапинг Walmart с обычными американскими прокси терпит неудачу чаще, чем большинство туториалов признают, даже когда IP-адреса продаются как «элитные» или резидентные. Проблема заключается не в качестве прокси как таковом. Она кроется в том, как запросы распределяются, ротируются и восстанавливаются со временем, а также в том, как антибот-стек Walmart считывает этот трафик на региональном уровне, а не на национальном. Американский IP больше не является пропуском.
Чтобы перевести это в цифры, мы провели контролируемый бенчмарк: 1000 запросов через обычный пул американских прокси к публичным страницам товаров и поиска Walmart, и 1000 запросов к тем же целям через Crawlbase Crawling API. Всё здесь, то, что мы измерили в ходе этого теста, а не универсальные константы, и весь тест воспроизводим из публичного репозитория, чтобы вы могли повторить его со своими прокси. Предупреждение о рамках: речь идёт только о публичных страницах товаров и цен. Уважайте условия использования Walmart, его robots.txt и разумную частоту запросов, и никогда не обращайтесь к данным аккаунтов или персональным данным.
Результаты бенчмарка в одной таблице
Вот главный результат до какого-либо анализа. Три строки рассказывают большую часть истории.
| Метрика | Обычные американские прокси | Crawlbase Crawling API |
|---|---|---|
| Процент успеха | 39,1% | 99,5% |
| Процент блокировок | 41,7% | 0,2% |
| Среднее время ответа | 14,6 с | 9,0 с |
Вот и вся история. Остальная часть этой статьи объясняет почему и что закрыло разрыв.
Почему обычные американские прокси не работают с Walmart
Большинство советов по прокси по-прежнему исходят из того, что американского IP достаточно для скрапинга американского ритейлера. Это предположение больше не выдерживает контакта с реальностью Walmart. Современные антибот-системы не смотрят на один сигнал; они оценивают запрос сразу по нескольким критериям:
- Репутация IP. Имеет ли выходной адрес историю автоматизированного или злоупотребительного трафика.
- Поведенческая согласованность. Выглядит ли паттерн запросов как поведение человека или цикла.
- Повторное использование сессии. Ведут ли куки и сессии себя так, как вёл бы себя реальный браузер.
- Концентрация регионального трафика. Генерирует ли небольшой набор локаций внезапно большой трафик.
- Частота запросов. Как быстро один адрес или диапазон обращается к сайту.
- Инфраструктурное отпечатывание. TLS, порядок заголовков и другие низкоуровневые признаки, выдающие скрипт.
Поскольку все эти факторы объединяются, два прокси из одной страны ведут себя совершенно по-разному. В нашем запуске некоторые IP работали некоторое время, а затем быстро деградировали, другие терпели неудачу с первого запроса, и значительная часть возвращала HTTP 200, передавая при этом страницу CAPTCHA или проверки вместо полезного HTML Walmart. Определённые группы прокси деградировали значительно быстрее других, что указывает на локализованную репутационную оценку, а не на простую фильтрацию по стране.
Самый важный урок из запуска: код статуса 200 означает, что TCP-запрос завершён, а не что вы получили данные Walmart. Многие «успешные» ответы были страницами с ботовой проверкой. Проверяйте тело ответа, а не только статус, иначе ваш процент успеха, фикция.
Именно поэтому в бенчмарке оценивалось качество ответа, а не коды статусов. Небольшой детектор блокировок сканировал каждое тело на наличие антибот-маркеров и считал запрос неудачным при их обнаружении:
markers = [ "robot or human", "verify you are a human", "access denied", "captcha", "blocked", ] blocked = any(m in html.lower() for m in markers)
Фильтрация по телу вместо статуса дала честные 39,1% вместо завышенного числа, которое вы получите, доверяя 200-ым ответам. Если вы потратили время на расшифровку кодов ответов для сложной цели, материал о кодах ошибок прокси объясняет, почему 403 и «мягкий» 200 с проверкой требуют разных реакций.
Настройка бенчмарка
В тесте использовались два Python-скрипта против одинаковых URL Walmart. Первый запускался через обычный пул американских прокси (смесь элитных, анонимных, прозрачных и датацентровых эндпоинтов) со случайной ротацией на каждый запрос, заголовками в стиле браузера, намеренно отключёнными повторными попытками и описанным выше детектором блокировок. Второй запускал те же цели через Crawlbase Crawling API. Цель состояла не в маркетинговых числах, а в реалистичной надёжности извлечения в реальных условиях Walmart, поэтому проверка ответов и отслеживание задержки были встроены в оба слоя.
Запрос считался успешным только если он возвращал HTTP 200, непустой HTML, полезное содержимое и отсутствие антибот-маркеров. Скрипты отслеживали процент успеха, время ответа, тип отказа, страницы CAPTCHA, 403-ошибки, пустой HTML и частичное или повреждённое содержимое. Тестировались как страницы товаров, так и страницы поиска, причём один и тот же набор URL использовался для обоих слоёв, чтобы сравнение было корректным.
Полные результаты
Разрыв между сырым списком прокси и управляемой оркестрацией краулинга проявился быстро. Обычные прокси были нестабильны при повторных запросах: одни терпели неудачу немедленно, другие деградировали после нескольких хороших ответов, и многие возвращали страницы с ботами несмотря на 200. Crawlbase держался стабильно на тех же целях и в среднем отвечал быстрее, даже обрабатывая при этом повторные попытки и маршрутизацию внутри себя.
| Метрика | Обычные американские прокси | Crawlbase Crawling API |
|---|---|---|
| Всего запросов | 1000 | 1000 |
| Реальные успехи (валидный HTML) | 391 | 995 |
| Заблокировано (страница с ботом) | 417 | 2 |
| Сбои (ошибки) | 192 | 3 |
| Процент успеха | 39,1% | 99,5% |
| Процент блокировок | 41,7% | 0,2% |
| Процент сбоев | 19,2% | 0,3% |
| Среднее время | 14 578 с | 9 001 с |
| Самый быстрый ответ | 9 331 с | 5 832 с |
| Самый медленный ответ | 58 086 с | 39 614 с |
Два факта бросаются в глаза. Более 40% запросов через обычные прокси задели антибот-защиту Walmart, и почти 20% потерпели полный отказ из-за мёртвых прокси или ошибок соединения. Crawlbase, тем временем, удерживал почти идеальное извлечение на тех же целях и при этом показывал более низкую среднюю задержку, несмотря на то что выполнял работу по повторным попыткам и маршрутизации, которую обычный запуск пропускал.
Почему стандартные советы неполны
В почти каждом туториале по Walmart встречаются три совета по прокси. Все три улучшили результаты в бенчмарке, и ни один из них не был достаточен сам по себе.
«Просто используйте резидентные прокси.» Резидентные IP повысили процент успеха, потому что выглядели как потребительский трафик, но без реальной стратегии ротации и географического распределения повторяющиеся поведенческие паттерны всё равно запускали антибот-систему. Повторное использование одних и тех же региональных групп ухудшало качество извлечения в ходе запуска. Компромиссы описаны в статье о датацентровых и резидентных прокси.
«Ротируйте прокси случайным образом.» Случайная ротация, это не то же самое, что умная. Обычный скрипт буквально выбирал случайно:
proxy = random.choice(working)
Это всё равно повторно использовало шумные диапазоны IP и продолжало концентрировать запросы в одних и тех же регионах, поэтому даже здоровые прокси в конечном счёте начинали возвращать заблокированный или частичный HTML. Правильная ротация, отдельная дисциплина, описанная в статье о ротации резидентных прокси.
«Достаточно американской локации.» Это чаще всего давало сбой. Одни американские прокси падали мгновенно, другие держались дольше, хотя все они происходили из одной страны. Такой разброс, признак регионального репутационного скоринга и поведенческого обнаружения, а не фильтрации по стране. Выбор американского выходного IP даёт вам вход на сайт; он ничего не делает для поведенческого и репутационного скоринга, который решает, останетесь ли вы.
Что реально работало: оркестрация, а не количество прокси
Наиболее стабильные результаты в бенчмарке давала интеллектуальная маршрутизация запросов, а не увеличение числа прокси. Трафик нужно было динамически распределять по инфраструктуре, чтобы он никогда не оседал в повторяющемся поведенческом паттерне, и обработка повторных попыток имела значение значительно большее, чем ожидалось. Наивные циклы повторных попыток с повторным использованием того же прокси обычно ухудшали ситуацию. Надёжной оказалась система, способная:
- Распределять трафик по регионам, а не концентрировать его.
- Адаптироваться к поведению цели по мере его изменения в ходе запуска.
- Восстанавливаться после временных сбоев, не перегружая мёртвый IP.
- Не повторять одну и ту же сигнатуру запроса снова и снова.
- Интеллектуально маршрутизировать запросы по пулу, а не случайно.
Вот в чём разница между управлением списком прокси и использованием управляемого слоя краулинга. Это различие и когда каждый из вариантов является правильным выбором рассмотрено в статье о backconnect-прокси и Crawling API.
Crawling API, это управляемый слой, который дал столбец 99,5% выше. Один эндпоинт обрабатывает ротацию, регионально-осведомлённую маршрутизацию, повторные попытки, рендеринг JavaScript и обнаружение блокировок, чтобы ваш код делал один запрос и получал обратно полезный HTML Walmart. Бесплатного уровня достаточно, чтобы самостоятельно воспроизвести этот бенчмарк.
Что Crawlbase делает иначе
Ключевой момент в том, что Crawlbase не предоставляет сырой список прокси. Это управляемый слой краулинга, который берёт на себя операционную работу, которую скрапинг сложной цели вроде Walmart обычно возлагает на вас. Вместо того чтобы строить собственные системы для ротации прокси, управления сессиями, оркестрации повторных попыток, регионального маршрутирования и восстановления после сбоев, вы передаёте URL одному API, и эти слои работают сами. Именно поэтому бенчмарк мог обойтись без пользовательской логики повторных попыток и маршрутизации, которая была нужна обычному запуску, и всё равно получить 99,5%. Та же логика управляемого слоя применима и к другим защищённым торговым целям; паттерны обобщаются на веб-скрапинг в электронной коммерции.
| Функция | Обычные американские прокси | Crawlbase Crawling API |
|---|---|---|
| Резидентная маршрутизация | Ограниченная | Автоматическая |
| Датацентровая маршрутизация | Ограниченная | Автоматическая |
| Регионально-осведомлённое распределение | Нет | Да |
| Обработка обнаружения блокировок | Ручная | Автоматическая |
| Поддержка рендеринга JavaScript | Нет | Да |
| Управление работоспособностью прокси | Ручное | Автоматическое |
| Управление сессиями | Ручное | Автоматическое |
Запустите сами
Бенчмарк полностью воспроизводим. В публичном репозитории есть оба скрипта, для обычных прокси и для Crawlbase, нацеленные на одни и те же цели Walmart, чтобы вы могли проверить числа, а не принимать их на веру.
Клонируйте репозиторий и перейдите в директорию с кодом:
git clone https://github.com/ScraperHub/us-proxies-for-web-scraping-best-residential-datacenter-options.git cd us-proxies-for-web-scraping-best-residential-datacenter-options/code
Создайте виртуальную среду и установите зависимости:
python -m venv .venv source .venv/bin/activate pip install -r requirements.txt
Запустите бенчмарк с обычными прокси, используя свой американский прокси. Флаг --runs управляет тем, сколько раз запрашивается каждый URL Walmart, а скрипт проверяет реальный успех извлечения, страницы CAPTCHA, заблокированные ответы, пустой HTML и тайминги, а не просто читает коды статусов:
python generic_proxy_benchmark.py --proxy "174.138.168.76:8001" --runs 3
Затем запустите бенчмарк Crawlbase с вашим API-токеном. То же поведение --runs, та же проверка, только маршрутизация через управляемый слой:
python crawlbase_benchmark.py --token "YOUR_CRAWLBASE_TOKEN" --runs 3
Под капотом скрипт Crawlbase, это один GET к API: целевой URL, ваш токен и параметр страны для привязки запроса к американскому выходу.
curl --location 'https://api.crawlbase.com?url=https%3A%2F%2Fwww.walmart.com%2Fip%2FHP-14-Athlon-4-256-Blue%2F18634911593&token=YOUR_CRAWLBASE_TOKEN&country=US'
Оба скрипта выдают сопоставимые метрики (процент успеха, сбои, тайминги, страницы CAPTCHA, заблокированный HTML, пустой HTML и реальный успех извлечения), чтобы вы могли сравнить обычные прокси с управляемым подходом на своей машине.
Почему стоимость успешного запроса важнее сырой цены прокси
Дешёвые прокси выигрывают в прайс-листе и проигрывают в реальности. Неудачные запросы требуют повторных попыток, повторные попытки расходуют трафик, а инженеры тратят часы на замену мёртвых прокси и отладку блокировок вместо отгрузки продукта. Число, которое действительно имеет значение, это эффективная стоимость одного успешного запроса, потому что дешёвый прокси быстро дорожает, когда половина запросов терпит неудачу.
| Метрика | Обычные американские прокси | Crawlbase Crawling API |
|---|---|---|
| Сырая стоимость прокси | ~$0–15 / 1К запросов | $13,50 / 1К запросов |
| Процент неудачных запросов | 60,9% | 0,5% |
| Среднее кол-во повторных попыток на успех | ~2,6x | ~1,01x |
| Оценочные инженерные накладные расходы | Высокие | Низкие |
| Эффективная стоимость успешного запроса | ~$23–45 / 1К успешных страниц | ~$13,57 / 1К успешных страниц |
Эффективная стоимость здесь учитывает накладные расходы на повторные попытки, неудачные попытки извлечения и время на обслуживание разработчиком. Сырая цена прокси выглядит дешевле в верхней части таблицы и оказывается выше в нижней, когда все эти расходы учтены. Обратите также внимание, что показатель Crawlbase отражает первый тарифный уровень примерно при 1000 запросов; стоимость одного запроса снижается с ростом объёма, поэтому разрыв увеличивается в пользу Crawlbase при производственных масштабах.
Ключевые выводы
- Измеренный разрыв велик. В нашем тесте на 1000 запросов обычные американские прокси дали 39,1% валидного извлечения; Crawlbase Crawling API дал 99,5%.
- Проверяйте тело, а не статус. Walmart возвращает 200-ые ответы, которые на самом деле являются страницами CAPTCHA, поэтому проценты успеха по коду статуса завышены.
- Американской локации недостаточно. Walmart оценивает IP по региональной репутации и поведению, поэтому два американских прокси ведут себя очень по-разному.
- Оркестрация важнее количества прокси. Регионально-осведомлённая маршрутизация и умные повторные попытки закрыли разрыв, а не увеличение пула.
- Стоимость успешного запроса, реальная метрика. Дешёвые прокси дорожают, как только учтены повторные попытки, мёртвые IP и инженерное время.
Часто задаваемые вопросы
Можно ли скрапить Walmart с обычными американскими прокси?
Можно, но надёжность низкая и непредсказуемая. В нашем бенчмарке обычные американские прокси возвращали валидный HTML Walmart только в 39,1% случаев; остальное составляли страницы с ботовой проверкой, 403-ошибки, пустые тела или мёртвые соединения. Обычные прокси могут работать для нескольких разовых запросов, но стабильное извлечение в масштабе требует правильной маршрутизации, обработки повторных попыток и географического распределения.
Достаточно ли резидентных прокси для скрапинга Walmart?
Сами по себе нет. Резидентные IP улучшают процент успеха, потому что выглядят как потребительский трафик, но Walmart также оценивает поведенческие паттерны, частоту запросов, согласованность сессий и региональную концентрацию со временем. В тестировании резидентные прокси часто работали поначалу, а затем деградировали после повторных запросов из одних и тех же регионов, поэтому то, как вы распределяете и ротируете запросы, имеет не меньшее значение, чем тип прокси.
Почему Walmart возвращает 403 даже с американскими прокси?
Потому что Walmart оценивает значительно больше, чем геолокацию на уровне страны. Прокси может физически находиться в США и всё равно выглядеть подозрительно из-за шумной репутации IP или повторяющегося паттерна трафика. В бенчмарке также встречалось множество HTTP 200-ответов, которые на самом деле были страницами с ботовой проверкой, поэтому нужно проверять тело ответа, а не только код статуса.
Crawlbase, это просто прокси-сервис?
Нет. Crawlbase, это управляемый слой краулинга, а не статический список прокси. Вместо того чтобы давать вам IP для самостоятельного управления, он обрабатывает маршрутизацию запросов, оркестрацию повторных попыток, ротацию, управление сессиями, регионально-осведомлённое распределение, рендеринг JavaScript и обнаружение блокировок за одним эндпоинтом, чтобы вы взаимодействовали с одним API, пока инфраструктурная работа выполняется за вас.
Законно ли скрапить Walmart?
Это руководство ограничено публичными страницами товаров и цен. Скрапинг публичных данных в целом является defensible, но вы всё равно должны уважать условия использования Walmart, его robots.txt и разумную частоту запросов, а также никогда не собирать данные аккаунтов или персональные данные. Если проекту нужно больше, чем публичные страницы, правильный путь, соглашение о данных, а не обходной манёвр.
Как не допустить блокировки скрапера Walmart?
Держите частоту запросов на регион низкой, отправляйте реалистичные заголовки браузера, проверяйте тела ответов на маркеры блокировки вместо того, чтобы доверять кодам статусов, и используйте интеллектуальную ротацию вместо случайной. Более широкий сценарий изложен в статье о скрапинге без блокировок, а передача ротации, повторных попыток и обнаружения блокировок управляемому слою устраняет большую часть работы по обслуживанию.
Обходите любой сайт в масштабе, без борьбы с инфраструктурой.
Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

