n8n завоевал свою аудиторию, потому что позволяет автоматизировать реальную работу без большого количества кода. Вы соединяете сервисы на визуальном холсте, запускаете действия по расписанию или событию и выстраиваете их в полноценные рабочие процессы. Дополните это MCP-сервером, способным читать живой веб, и ваши шаги ИИ перестанут угадывать по устаревшим обучающим данным и начнут действовать на основе того, что страница реально говорит сегодня.

Это руководство показывает, как соединить n8n с Crawlbase Web MCP от начала до конца: запустить сервер Web MCP, добавить узел MCP Client Tool в n8n, указать его на сервер и построить небольшой рабочий процесс ИИ, который краулит страницу и создаёт её краткое изложение. Никакого кода собственного скрапера, никакого пула прокси для присмотра. В итоге у вас появится рабочий цикл, в котором ИИ-агент самостоятельно тянется к инструменту краулинга и возвращает вам чистый структурированный результат.

Зачем вообще подключать n8n к MCP-серверу

ИИ-агент в n8n ровно настолько хорош, насколько хороши данные, до которых он может добраться. Сам по себе он умеет рассуждать и писать, но не может видеть живую страницу продукта, цены конкурента или новостную статью, опубликованную час назад. Model Context Protocol (MCP) закрывает этот пробел: это стандартный интерфейс, позволяющий ИИ-модели вызывать внешние инструменты без специальной интеграции для каждого из них. Запустите MCP-сервер, и любой MCP-совместимый клиент, включая n8n, сможет вызывать функции, которые этот сервер предоставляет.

Crawlbase Web MCP-сервер предоставляет краулинг в виде набора инструментов. После подключения ваш ИИ-агент в n8n получает возможность запрашивать URL и получать в ответ готовый HTML, чистый markdown или скриншот, и всё это через антиблокировочную инфраструктуру Crawlbase. Та же идея описана в материале о представлении Crawlbase MCP: подключаемый мост между LLM-агентами и живым вебом.

Что нужно подготовить заранее

Подготовьте это заранее, и остальная настройка займёт считанные минуты:

  • n8n подходит как десктопное приложение, так и n8n Cloud; единственное различие в том, как n8n достигает вашего локального MCP-сервера.
  • Аккаунт Crawlbase зарегистрируйтесь, чтобы получить бесплатные токены API из панели управления. Вам понадобятся оба: Normal token и JavaScript token.
  • Node.js необходим для запуска Crawlbase Web MCP-сервера локально.
  • ngrok (опционально) только для пользователей n8n Cloud, которым нужно сделать локальный сервер доступным через интернет.

Как n8n взаимодействует с Crawlbase через MCP

Вместо того чтобы писать HTTP-интеграцию с заголовками и логикой повторных попыток, вы запускаете MCP-сервер и позволяете n8n вызывать его. Поток короткий:

  • Узел MCP Client Tool в n8n подключается к запущенному MCP-серверу.
  • Crawlbase Web MCP-сервер предоставляет сами функции краулинга.
  • Ваш ИИ-агент выбирает нужный инструмент, рабочий процесс получает данные, и следующий шаг действует на их основе.

Вы никогда не трогаете токены API внутри n8n, потому что токены живут на сервере, который вы запускаете на шаге 1. n8n просто вызывает инструменты и читает результат.

Шаг 1: Установка и запуск Crawlbase Web MCP-сервера

Сервер делает инструменты краулинга доступными для n8n, поэтому он должен быть запущен до того, как n8n сможет что-либо увидеть. Откройте терминал и скачайте проект.

bash
git clone https://github.com/crawlbase/crawlbase-mcp
cd crawlbase-mcp
npm install

Теперь запустите сервер в режиме HTTP-транспорта, передав оба токена как переменные окружения. Замените заглушки реальными значениями из вашей панели управления Crawlbase.

bash
CRAWLBASE_TOKEN=your_token CRAWLBASE_JS_TOKEN=your_js_token npm run start:http

Два токена выполняют разные задачи:

  • CRAWLBASE_TOKEN обрабатывает стандартный краулинг статических страниц.
  • CRAWLBASE_JS_TOKEN обрабатывает страницы, которые рендерят контент с помощью JavaScript, запуская перед возвратом HTML настоящий браузер.

Если всё установлено правильно, сервер запускается по адресу http://localhost:3000. Оставьте это окно терминала открытым. n8n подключается к этому запущенному процессу при каждом срабатывании рабочего процесса, поэтому закрытие окна прерывает связь.

Оба токена, намеренно

Crawlbase выдаёт два типа токенов. Normal token получает статический HTML; JavaScript (JS) token сначала рендерит страницу в настоящем браузере. Передача обоих при запуске позволяет ИИ-агенту краулить простые страницы дёшево и при этом справляться с сайтами, рендерящимися на стороне клиента, без каких-либо переключений в середине рабочего процесса. Оба токена можно найти в панели управления в разделе документации аккаунта.

Опционально для пользователей n8n Cloud: откройте сервер через ngrok

n8n Desktop работает на той же машине, что и MCP-сервер, поэтому http://localhost:3000 работает напрямую и этот шаг можно пропустить. n8n Cloud работает на серверах n8n, поэтому ему нужен публичный URL для доступа к серверу на вашей машине. ngrok создаёт для этого безопасный туннель.

bash
ngrok http 3000

ngrok выводит публичный HTTPS-URL, указывающий на ваш локальный порт 3000. Используйте этот URL в качестве конечной точки в n8n вместо localhost. Поскольку это открывает ваш MCP-сервер интернету, держите URL и токены в тайне.

Шаг 2: Подключение n8n к Crawlbase Web MCP-серверу

Откройте n8n и перейдите в свой рабочий процесс. Добавьте узел MCP Client Tool рядом с узлом ИИ-агента. Этот узел даёт агенту доступ к инструментам краулинга Crawlbase. Настройте его следующим образом:

  • Endpoint: используйте http://localhost:3000 в n8n Desktop или ваш ngrok HTTPS-URL в n8n Cloud.
  • Server Transport: выберите HTTP Streamable, что соответствует режиму start:http, в котором вы запустили сервер.
  • Authentication: установите None; ваши токены уже были переданы серверу на шаге 1, поэтому n8n они не нужны.
  • Tools to Include: выберите All, чтобы агент мог выбрать подходящий инструмент краулинга для задачи.

При успешном подключении узел выводит список инструментов, которые предоставляет сервер:

json
{
  "tools": [
    { "name": "crawl", "description": "Crawl a URL and return HTML" },
    { "name": "crawl_markdown", "description": "Extract clean markdown from a URL" },
    { "name": "crawl_screenshot", "description": "Take a screenshot of a webpage" }
  ]
}

Наличие crawl, crawl_markdown и crawl_screenshot подтверждает, что связь установлена. Если список пуст, подключение не завершилось; раздел устранения неполадок ниже охватывает типичные причины.

Crawlbase Web MCP

Web MCP-сервер превращает инфраструктуру краулинга Crawlbase в инструменты, которые может вызывать любой MCP-клиент. Он рендерит JavaScript-страницы в настоящем браузере, ротирует жилые IP на стороне сервера и возвращает HTML, markdown или скриншот, чтобы ваш агент n8n читал живой веб без запуска парка безголовых браузеров или пула прокси. Начните на бесплатном тарифе и укажите на публичную страницу.

Шаг 3: Создание первого ИИ-рабочего процесса для скрапинга

После подключения инструментов создайте небольшой рабочий процесс, который загружает веб-страницу и создаёт её краткое изложение. Он состоит из двух основных частей:

  • Узел AI Agent, у которого уже подключён MCP Client Tool в качестве инструмента.
  • Узел Chat Model (OpenAI, Anthropic или любая модель, которую поддерживает n8n), которую агент использует для рассуждения и написания текста.

Внутри узла AI Agent задайте ему промпт, объясняющий, что нужно сделать. Агент читает промпт, решает, что нужно выполнить краулинг, вызывает нужный инструмент и передаёт результат модели. Простой пример:

bash
Crawl https://crawlbase.com/blog and summarize the
latest article in three bullet points.

Нажмите Execute step на узле AI Agent. Через мгновение краткое изложение появится в выводе. За кулисами агент обратился к crawl_markdown, который возвращает чистый markdown, гораздо более удобный для модели, чем сырой HTML, а затем передал этот текст чат-модели для создания краткого изложения. Откройте журналы выполнения рабочего процесса, чтобы увидеть всю цепочку: запрос краулинга, markdown, возвращённый сервером, и итоговый ответ модели.

Это основной цикл. Агент решает, какой инструмент использовать, на основе вашего промпта, поэтому просьба «сделать скриншот» страницы направляет его к crawl_screenshot без каких-либо изменений узлов с вашей стороны. Если вы хотите углубиться в тему выбора инструментов агентом и работы с веб-данными, материал о извлечении данных с помощью ИИ и принципах его работы охватывает этот паттерн.

Устранение неполадок подключения

Большинство проблем при настройке относятся к нескольким категориям. Быстрые проверки обычно их устраняют:

n8n не может подключиться к MCP-серверу

  • Убедитесь, что сервер всё ещё работает в окне терминала и не завершил работу.
  • Проверьте конечную точку: http://localhost:3000 для Desktop или текущий ngrok HTTPS-URL для Cloud (ngrok выдаёт новый URL при каждом перезапуске).
  • Убедитесь, что ничто другое на вашей машине не занимает порт 3000.

В узле MCP Client Tool не отображаются инструменты

  • Убедитесь, что Server Transport установлен в HTTP Streamable для соответствия режиму запуска start:http.
  • Обновите список инструментов в узле.
  • Если список по-прежнему пуст, перезапустите и MCP-сервер, и n8n, а затем переподключитесь.

Ошибки токена или прав доступа

  • Скопируйте оба токена из панели управления заново, чтобы исключить лишние пробелы или пропущенные символы.
  • Убедитесь, что на вашем аккаунте достаточно кредитов для выполнения запроса.
  • Если страница с большим количеством JavaScript возвращается пустой, убедитесь, что CRAWLBASE_JS_TOKEN был установлен при запуске сервера.

Вывод пуст или выглядит неправильно

  • Откройте журналы выполнения, чтобы точно увидеть, что вернул краулинг.
  • Сначала протестируйте с более простым статическим URL, чтобы определить, проблема в странице или в промпте.
  • Уточните промпт, чтобы он чётко указывал агенту выполнить краулинг перед созданием краткого изложения.

Куда двигаться дальше

Рабочий процесс с кратким изложением намеренно небольшой, но та же схема масштабируется в реальную автоматизацию. Несколько направлений, которые стоит попробовать:

  • Краулить страницы конкурентов по расписанию и публиковать краткие изложения в Slack.
  • Отслеживать цены на продукты на нескольких сайтах и запускать уведомление при изменении одной из них.
  • Собирать несколько статей по одной теме и позволять модели создавать сводный обзор.
  • Собирать публичные данные о бизнесах из каталогов и направлять их в CRM.
  • Отслеживать изменения ключевых страниц с течением времени для SEO или работы по соответствию требованиям.

Поскольку MCP-сервер работает через инфраструктуру Crawlbase, сложные части скрапинга (рендеринг, ротация и обход блокировок) решаются за вас. Если вы всё же столкнётесь с сопротивлением на сложной цели, материал о как скрапить сайты без блокировок, ваш плейбук. А если вы взвешиваете, как сравниваются управляемый доступ и сырое проксирование, полезно прочитать материал о что такое ИИ-прокси. Для более тяжёлых пользовательских сборок вне n8n Crawling API и Smart AI Proxy предоставляют тот же движок для прямого вызова.

Привлекательность этой схемы в том, что она работает без кода: n8n управляет автоматизацией, Crawlbase выполняет краулинг, а MCP синхронизирует их. Crawlbase доверяют более 70 000 разработчиков, поэтому уровень краулинга под вашим рабочим процессом, тот же, что работает в производственных скраперах в масштабе.

Итоги

Ключевые выводы

  • MCP, это мост. Он позволяет ИИ-агенту n8n вызывать внешние инструменты, а Crawlbase Web MCP-сервер предоставляет краулинг в виде этих инструментов.
  • Токены хранятся на сервере. Запускайте его с обоими токенами CRAWLBASE_TOKEN и CRAWLBASE_JS_TOKEN; n8n подключается с Authentication, установленным в None.
  • Соответствуйте транспорту. Запускайте с start:http и устанавливайте Server Transport узла в HTTP Streamable, указывая на localhost:3000 или ngrok-URL.
  • Агент выбирает инструмент. crawl, crawl_markdown и crawl_screenshot выбираются агентом на основе вашего промпта.
  • Никакого кода, никакого пула прокси. Crawlbase обрабатывает рендеринг, ротацию и блокировки, чтобы рабочий процесс оставался чистым.

Часто задаваемые вопросы

Что такое Crawlbase Web MCP-сервер?

Это небольшой сервер, предоставляющий функции краулинга Crawlbase в виде инструментов Model Context Protocol. Любой MCP-совместимый клиент, включая n8n, Claude Desktop и Cursor, может подключиться к нему и вызывать функции вроде crawl, crawl_markdown и crawl_screenshot для получения живых веб-данных без написания собственной интеграции.

Нужны ли мне оба токена Crawlbase для подключения n8n?

Используйте оба для наиболее плавной настройки. CRAWLBASE_TOKEN обрабатывает статические страницы, а CRAWLBASE_JS_TOKEN рендерит JavaScript-интенсивные страницы в настоящем браузере. Передача обоих при запуске сервера позволяет ИИ-агенту краулить простые и сложные страницы без каких-либо переключений в рабочем процессе.

В чём разница между n8n Desktop и n8n Cloud для этой настройки?

n8n Desktop работает на той же машине, что и MCP-сервер, поэтому он может обращаться к http://localhost:3000 напрямую. n8n Cloud работает на серверах n8n, поэтому ему нужен публичный URL; проложите туннель к локальному серверу через ngrok и используйте этот HTTPS-адрес в качестве конечной точки.

Почему в узле MCP Client Tool не отображаются инструменты?

Наиболее распространённая причина, несоответствие транспорта: убедитесь, что Server Transport установлен в HTTP Streamable для соответствия режиму запуска start:http. Также убедитесь, что сервер всё ещё работает, конечная точка правильная и порт 3000 свободен. Обновление списка инструментов или перезапуск и сервера, и n8n обычно решают проблему.

Нужно ли писать какой-либо код для использования этого?

Нет. Помимо пары команд в терминале для запуска сервера, весь рабочий процесс строится визуально в n8n. ИИ-агент сам решает, какой инструмент краулинга вызвать, на основе вашего промпта, поэтому вы один раз подключаете узлы и управляете всем через простые инструкции.

Может ли ИИ-агент самостоятельно выбрать инструмент краулинга?

Да. При установке Tools to Include в All агент читает ваш промпт и выбирает подходящий инструмент. Попросите его сделать краткое изложение страницы, и он обратится к crawl_markdown; попросите скриншот, и он использует crawl_screenshot. Вы управляете выбором через формулировку промпта, а не через настройки узлов.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга