Раньше исследование товаров означало открытие дюжины вкладок браузера, ручное копирование цен в таблицу и повторение всего этого на следующей неделе. Автоматизация этой работы была доступна только разработчикам, поскольку требовала написания скраперов, управления прокси и постоянного наблюдения за кодом. Этот барьер исчез. Визуальные инструменты автоматизации теперь позволяют каждому настроить рабочий процесс, самостоятельно собирающий данные о товарах, без какого-либо опыта программирования.

Это руководство показывает, как автоматизировать исследование товаров eCommerce с помощью n8n, платформы автоматизации с открытым исходным кодом, и Crawlbase, который берёт на себя сложную задачу получения живых страниц товаров с таких сайтов, как Amazon. Вы создадите рабочий процесс, который читает список товаров из Google Sheet, получает свежие данные для каждого через Crawlbase и записывает результаты обратно, чтобы ваши исследования оставались актуальными без вашего участия. Мы рассмотрим два способа соединения: Web MCP для потока на основе ИИ и Crawling API для прямого, предсказуемого подхода.

Зачем автоматизировать исследование товаров

Ручное исследование не масштабируется. Как только вы отслеживаете больше нескольких товаров, цикл копирования и вставки съедает ваш день, а данные устаревают к тому моменту, когда вы заканчиваете. Хуже того, цены и наличие постоянно меняются, поэтому разовый снимок почти ничего не говорит о рынке. Ценность в том, чтобы наблюдать за одним набором товаров со временем и замечать изменения.

Автоматизированный рабочий процесс превращает это в фоновый процесс. Вы один раз определяете товары, устанавливаете расписание, и данные обновляются сами. Такая настройка окупается для нескольких ролей:

  • Исследователи eCommerce, формирующие большие наборы данных для нишевого анализа
  • Аналитики конкурентов, отслеживающие движение цен и наличия
  • Amazon-продавцы, мониторящие собственные и конкурентные листинги
  • Аналитики данных, изучающие рыночные тенденции на протяжении недель или месяцев

Место, на котором спотыкается большинство, это получение данных. Amazon и другие крупные ретейлеры рендерят контент с помощью JavaScript и агрессивно проверяют автоматизированный трафик, поэтому обычный HTTP-запрос обычно возвращает почти пустую страницу или блокировку. Именно эту задачу решает Crawlbase, и именно поэтому данный рабочий процесс остаётся надёжным, а не ломается при первом ужесточении защиты сайта.

Что нужно подготовить

Вы соединяете несколько инструментов, а не пишете код. Сначала подготовьте следующее:

  • n8n для создания и запуска автоматизации. Используйте локальную установку или n8n Cloud; для этого рабочего процесса они работают одинаково.
  • Аккаунт Crawlbase для выполнения краулинга. Зарегистрируйтесь, затем скопируйте токены API из дашборда. Вы получаете Normal токен для статичных страниц и JavaScript токен для страниц с клиентским рендерингом.
  • Аккаунт Google с включённым Sheets API, чтобы n8n мог читать список товаров и записывать результаты обратно. Вы подключаете его при первом добавлении узла Google Sheets.
  • Google Sheet со списком товаров, для начала достаточно одного столбца с ASIN Amazon. Назовите столбец что-то понятное, например ASIN.

Весь поток короткий: ваша таблица содержит список товаров, n8n запускает рабочий процесс по триггеру или расписанию, Crawlbase получает страницу каждого товара и возвращает чистые структурированные данные, а n8n записывает их обратно в таблицу.

Два способа подключить n8n к Crawlbase

Есть два надёжных пути, и выбор зависит от того, сколько контроля и гибкости вам нужно.

Путь через Web MCP открывает краулинг как инструменты, которые AI Agent в n8n может вызывать самостоятельно. Вы описываете цель на обычном языке, агент решает, какой инструмент использовать, и получает структурированный вывод. Он хорош, когда цели меняются или вы хотите, чтобы модель рассуждала над страницей. Полное руководство по Web MCP охватывает эту настройку от начала до конца.

Путь через Crawling API, прямой HTTP-вызов. Вы отправляете URL и токен, получаете данные, каждый раз, без модели в цепочке. Он предсказуем, дёшев и является правильным выбором по умолчанию для целенаправленной задачи вроде извлечения одних и тех же полей со страниц товаров. Именно этот путь мы реализуем ниже, поскольку исследование товаров, чётко определённая задача, с которой встроенный парсер справляется именно так, как нужно.

Какой токен использовать

Crawlbase выдаёт два типа токенов. Normal токен получает статичный HTML; JavaScript (JS) токен сначала рендерит страницу в реальном браузере. Страницы товаров Amazon загружают ключевые данные на стороне клиента, поэтому используйте здесь JS-токен. Применение Normal токена на странице с клиентским рендерингом вернёт тонкую оболочку с отсутствующими данными.

Шаг 1: Создание нового рабочего процесса в n8n

Войдите в n8n и нажмите Create Workflow. Дайте ему понятное имя, например "Amazon Product Data Collector", чтобы найти его позднее, когда у вас будет несколько рабочих процессов. Вы начинаете с пустого холста; всё остальное, перетаскивание узлов на него и их соединение.

Шаг 2: Чтение списка товаров из Google Sheets

Добавьте узел Google Sheets и выберите триггер On row added or updated. Он запускает рабочий процесс автоматически при добавлении нового ASIN в таблицу, так что исследование начинается в момент добавления нового объекта для поиска.

Пройдите аутентификацию через аккаунт Google, затем выберите таблицу и лист с вашим списком ASIN. Нажмите Fetch Test Event, чтобы убедиться, что соединение получает строку. Как только это сработает, n8n точно знает, откуда читать ваши товары, и каждая проходящая строка содержит значение ASIN, которое может использовать следующий шаг.

Шаг 3: Получение данных о товаре через Crawling API

У n8n нет специального узла Crawlbase, поэтому вы используете встроенный узел HTTP Request для прямого вызова Crawling API. Добавьте его после узла Google Sheets и настройте параметры:

  • Method: GET
  • URL: https://api.crawlbase.com
  • Authentication: None
  • Send Query Parameters: включить

Затем добавьте три параметра запроса. Значение url строится динамически из ASIN, пришедшего через триггер, так что каждая строка получает свою страницу товара:

text
token     your_crawlbase_js_token
url       https://www.amazon.com/dp/{{ $json.ASIN }}/ref=nosim
scraper   amazon-product-details

Три значения выполняют работу. token, это ваш JavaScript-токен из дашборда. url использует выражение n8n {{ $json.ASIN }} для подстановки ASIN текущей строки в URL товара Amazon, так что один и тот же узел обрабатывает каждый товар без правок. scraper указывает Crawlbase запустить встроенный парсер amazon-product-details, который возвращает страницу уже структурированной в JSON, а не в виде сырого HTML, который пришлось бы парсить самостоятельно.

Нажмите Execute Node и в панели вывода должен появиться JSON-ответ с полями вроде name, price, rating и reviewCount. Структура выглядит следующим образом:

json
{
  "body": {
    "name": "Wireless Noise Cancelling Headphones",
    "price": "$248.00",
    "rating": "4.6",
    "reviewCount": 31482,
    "inStock": true
  }
}

Поскольку встроенный парсер уже разобрал страницу, вы читаете эти поля по имени в следующем узле. Никаких CSS-селекторов, XPath, ничего того, что сломается при редизайне Amazon.

Crawlbase Crawling API

n8n управляет автоматизацией, но самостоятельно не может преодолеть защиту Amazon от ботов. Crawling API закрывает этот пробел в одном вызове: передайте JS-токен, и он рендерит страницу в реальном браузере, ротирует жилые IP на стороне сервера и возвращает чистые структурированные данные, так что вам не нужно управлять парком безголовых браузеров и пулом прокси самостоятельно. Начните бесплатно с лимитом до 20 000 запросов и направьте на публичную страницу товара сначала.

Шаг 4: Запись результатов обратно в Google Sheets

Теперь сохраните собранное. Откройте вашу таблицу и добавьте столбцы для нужных полей, например ASIN, Title, Price, Rating и URL. Вы всегда можете добавить больше позже, по мере того как будете решать, что важно для вашего исследования.

Вернитесь в n8n, добавьте второй узел Google Sheets после HTTP Request и выберите действие Append or update row in sheet. Установите Column to match on как ASIN, чтобы каждый товар обновлял свою строку, а не создавал дубликаты при каждом запуске. Затем сопоставьте поля из ответа Crawling API со своими столбцами:

text
ASIN     {{ $('Google Sheets Trigger').item.json.ASIN }}
Title    {{ $json.body.name }}
Price    {{ $json.body.price }}
Rating   {{ $json.body.rating }}
URL      {{ $json.url }}

ASIN берётся из исходного триггера, чтобы всегда соответствовать правильной строке, а поля товара, из body ответа Crawling API. Запустите рабочий процесс один раз и наблюдайте, как таблица заполняется названиями, ценами и рейтингами, аккуратно выровненными по ASIN.

Шаг 5: Активация и планирование

Переключите рабочий процесс в состояние Active в правом верхнем углу. Теперь добавление ASIN в таблицу запускает свежий краулинг и записывает детали обратно в течение секунд. Одно это устраняет цикл ручного поиска.

Для непрерывного исследования нужно, чтобы данные обновлялись сами, а не только при добавлении строк. Добавьте узел Schedule Trigger, запускающий рабочий процесс ежедневно или каждые несколько часов, и возвращайте ваш существующий список ASIN через Crawling API. Теперь таблица отслеживает изменения цен и наличия со временем без каких-либо действий с вашей стороны, и в этом весь смысл автоматизации исследований, а не просто их ускорения.

Как сделать рабочий процесс более полезным

Когда базовая схема работает, несколько небольших дополнений превращают сборщик данных в настоящий инструмент исследования. Ничего из этого не требует переделки.

Собирайте больше полей

Встроенный парсер возвращает больше, чем название и цена. Сопоставьте rating, reviewCount, имя продавца или наличие, чтобы получить более полное представление о том, как работает товар и как это меняется со временем. Более богатые данные, вот что делает трендовый анализ оправданным.

Меняйте парсеры

У Crawlbase есть встроенные парсеры для многих сайтов, а не только для Amazon. Чтобы исследовать другую платформу, измените параметр запроса scraper и целевой URL; остальная часть рабочего процесса остаётся прежней. Подход с AI Agent рабочим процессом идёт ещё дальше и позволяет агенту самостоятельно выбирать правильный инструмент для каждой цели, что удобно, когда источники меняются.

Сохраняйте спарсенные страницы для последующего использования

Если вы хотите иметь резервную копию всего, что получаете, добавьте store=true в запрос Crawling API, и Crawlbase сохранит копию каждого краулинга в вашем аккаунте. Это позволяет возвращаться к старым снимкам или сравнивать изменения без повторного краулинга, что полезно для аудитов и исторического анализа.

Направляйте данные куда угодно

Google Sheets, простейшее назначение, но n8n подключается к сотням сервисов. Отправляйте оповещения в Slack, когда конкурент снижает цену, добавляйте строки в базу данных или питайте дашборд. Шаг краулинга не меняется; вы просто добавляете узел после него.

Как оставаться незаблокированным в масштабе

Причина, по которой этот рабочий процесс продолжает работать там, где самодельный скрапер остановится, в том, что Crawling API обрабатывает рендеринг и ротацию IP за вас. Он выполняет каждый запрос через реальный браузер и ротируемые жилые IP, так что Amazon видит нормальный трафик, а не очевидного бота. Если вы предпочитаете маршрутизировать собственные запросы через ротируемый пул, Smart AI Proxy предоставляет ту же жилую ротацию в качестве drop-in эндпоинта. В любом случае, более широкая тактика описана в статье о том, как парсить сайты без блокировок.

Итоги

Ключевые выводы

  • Разделяйте работу. n8n управляет автоматизацией, Google Sheets хранит данные; Crawlbase получает страницы товаров и возвращает их структурированными. Каждая часть делает то, в чём хороша.
  • Используйте встроенный парсер. Парсер amazon-product-details возвращает разобранный JSON, так что вы читаете поля вроде name и price по имени без селекторов для обслуживания.
  • Используйте JS-токен для Amazon. Детали товара рендерятся на стороне клиента, поэтому JavaScript-токен рендерит страницу в реальном браузере перед возвратом данных.
  • Планируйте запуски. Schedule Trigger обновляет ваш список автоматически, превращая разовый парсинг в непрерывное отслеживание тенденций.
  • Два пути подключения. Используйте Crawling API для прямого, предсказуемого задания или Web MCP, когда хотите, чтобы AI Agent выбирал инструменты для разнообразных целей.

Часто задаваемые вопросы

Нужно ли уметь программировать для создания этого рабочего процесса?

Нет. Весь рабочий процесс создаётся визуально в n8n перетаскиванием узлов и заполнением полей. Вы не пишете ни одного скрипта. Единственные технически выглядящие части, выражения n8n вроде {{ $json.ASIN }}, которые просто подставляют значение из предыдущего шага, и вы копируете их прямо из этого руководства.

Что выбрать: Web MCP или Crawling API?

Используйте Crawling API для целенаправленного, повторяемого задания вроде извлечения одних и тех же полей со страниц товаров, это прямой вызов с предсказуемой стоимостью и результатом. Обращайтесь к Web MCP, когда хотите, чтобы AI Agent в n8n решал, какой инструмент краулинга использовать для разнообразных или меняющихся целей. Оба работают на одном движке краулинга Crawlbase, так что можно начать с одного и переключиться позже.

Зачем использовать Crawlbase вместо прямого HTTP-запроса к Amazon?

Amazon рендерит детали товара с помощью JavaScript и агрессивно блокирует автоматизированный трафик, поэтому прямой запрос обычно возвращает пустую оболочку или страницу блокировки. Crawlbase рендерит страницу в реальном браузере за ротируемыми жилыми IP, затем возвращает чистые структурированные данные, это и есть то, что не даёт рабочему процессу сломаться в момент масштабирования.

Как исследовать товары на сайтах, отличных от Amazon?

Измените параметр запроса scraper на соответствующий вашей целевой платформе и обновите URL, который строит рабочий процесс. У Crawlbase есть встроенные парсеры для многих платформ, а остальная часть рабочего процесса в n8n, триггер и запись в Google Sheets, остаётся ровно такой же.

Меня заблокируют?

Crawling API ротирует жилые IP и рендерит страницы на стороне сервера, что обрабатывает большинство блокировок за вас. Для безопасности в масштабе регулируйте запросы через Schedule Trigger, а не долбите сайт, варьируйте цели и следите за кодами статуса ответов, чтобы можно было снизить нагрузку, если сайт начнёт проверять трафик.

Можно ли хранить историю собранных данных?

Да. Добавьте store=true в запрос Crawling API, и Crawlbase сохранит копию каждого краулинга в вашем аккаунте, так что можно возвращаться к старым снимкам или сравнивать изменения без повторного получения. На стороне n8n регулярные запуски по одному и тому же списку ASIN формируют постоянную запись о том, как цены и наличие меняются со временем.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга