Поиск качественных лидов, это медленная работа. Любой, кто занимался продажами или маркетингом, знает эту рутину: открыть браузер, искать компании, подходящие под ваш профиль, копировать их данные в таблицу, повторять. Это руководство показывает, как пропустить большую часть этого процесса, создав AI-бот для продаж с Crawlbase Web MCP, ассистента, который самостоятельно собирает публичные данные о компаниях и контактных страницах и составляет за вас тексты для охвата.
Для честности и защищённости вся разработка ограничена публичными бизнес-данными: названия компаний, сайты, публичные контактные страницы, указанные отрасли и общие email-адреса, которые бизнес публикует для входящих запросов. Бот не скрейпит контент за стеной авторизации, не покупает и не собирает персональные данные, не пытается обогащать информацию об отдельных людях сверх того, что компания решила опубликовать. Раздел об этике и условиях использования ближе к концу, не шаблонный, поэтому прочитайте его, прежде чем направить это на реальный объём.
Что на самом деле делает AI-бот для продаж, построенный на Crawlbase Web MCP
Паттерн прост, когда видишь обе половины. Claude (или любой MCP-совместимый клиент) обеспечивает рассуждение: читает ваш запрос, решает, на какие страницы смотреть, и структурирует результат. Crawlbase Web MCP обеспечивает руки: загружает живые страницы, рендерит JavaScript-heavy сайты, справляется с распространёнными блокировками и возвращает чистый контент для чтения моделью.
Сам по себе языковой агент не может надёжно просматривать открытый веб. Сервер MCP закрывает этот пробел. Он предоставляет небольшой набор инструментов, которые модель может вызывать для краулинга и чтения URL, поэтому вместо того, чтобы вставлять содержимое страниц вручную, модель запрашивает их самостоятельно и работает со структурированным выводом. Если хотите увидеть полную картину того, почему это важно, статья передача данных реального времени в LLM подробно раскрывает мотивацию.
Реалистичный запуск выглядит так: вы описываете идеальный профиль клиента, бот находит подходящие компании, посещает публичный сайт и контактную страницу каждой компании, извлекает запрошенные поля и возвращает аккуратную таблицу плюс черновики текстов для охвата, адаптированные под каждую компанию. Никаких скриптов скрейпинга, никакого прокси-пула для обслуживания, никакой браузерной автоматизации для поддержки.
Всё описанное ниже нацелено на данные, которые компания публикует для широкой аудитории: её сайт, указанную отрасль и общие контактные адреса (sales@, hello@, info@), которые она просит использовать для связи. Боту явно предписано не собирать персональные данные об отдельных людях. Именно эта граница делает работу защищённой, и она закреплена в промпте, а не оставлена на волю случая.
Как части сочетаются друг с другом
Три компонента выполняют работу, и полезно назвать их перед тем, как что-либо подключать.
Claude, уровень рассуждения
Модель разбивает ваш запрос на шаги, решает, какие страницы стоит посетить, выбирает поля для извлечения и форматирует результат. Вы описываете желаемый результат обычным языком, а она планирует путь. Это именно та часть, которую вы иначе делали бы вручную.
Web MCP, уровень краулинга
Сервер MCP позволяет модели добраться до живого веба. Он загружает страницу за надёжным IP, рендерит клиентский контент, справляется с распространёнными антибот-препятствиями и возвращает чистый вывод. Под капотом он опирается на ту же инфраструктуру, что и Crawling API и Smart AI Proxy, поэтому вы получаете данные в реальном времени без необходимости собирать headless-флот и ротируемый прокси-пул самостоятельно.
Ваш вывод, структурированные лиды плюс черновики
Когда страницы возвращаются, модель собирает каждую компанию в строку: название, сайт, публичный контактный email, отрасль, краткое описание, а затем составляет короткое сообщение для охвата, привязанное к тому, что она прочитала на сайте этой компании. Вы можете экспортировать таблицу в CSV для CRM или продолжить итерации в чате.
Шаг 1: Установка и настройка Web MCP
Web MCP работает как локальный сервер, который запускает ваш MCP-клиент. Для Claude Desktop откройте Settings, Developer, Edit Config и добавьте сервер Crawlbase в блок mcpServers. Конфигурация ниже указывает клиенту на опубликованный пакет и передаёт ваши токены через переменные окружения.
{ "mcpServers": { "crawlbase": { "command": "npx", "args": ["-y", "crawlbase-mcp"], "env": { "CRAWLBASE_TOKEN": "YOUR_NORMAL_TOKEN", "CRAWLBASE_JS_TOKEN": "YOUR_JS_TOKEN" } } } }
Два токена, оба из вашего дашборда Crawlbase. Обычный токен загружает статический HTML; JavaScript (JS) токен сначала рендерит страницу в настоящем браузере. Сайты компаний, строящие контент на клиенте, требуют JS-токена, поэтому держите оба доступными и позвольте боту выбирать. Сохраните конфигурацию и перезапустите клиент, чтобы он подхватил новый сервер.
Обычный токен быстрее и дешевле, подходит для обычных серверно-рендеренных страниц. JS-токен запускает настоящий браузер и нужен для сайтов, загружающих контент с помощью JavaScript. Многие маркетинговые сайты достаточно статичны для обычного токена; прибегайте к JS-токену, когда страница возвращается тонкой или пустой.
Шаг 2: Подтверждение работы инструментов
После перезапуска ваш клиент должен показывать инструменты Crawlbase (обычно инструмент crawl и инструмент read). Быстрая проверка, попросить модель загрузить одну известную публичную страницу и резюмировать её. Если она возвращает реальный контент, а не извинения об отсутствии доступа к вебу, сервер подключён правильно.
Using the Crawlbase Web MCP, fetch https://example.com and give me a one-line summary of what the company does.
Если это возвращает реальное резюме, модель вызывает инструменты MCP и читает живые страницы. Вы готовы дать ей реальное задание.
Шаг 3: Дайте боту его торговый бриф
Теперь вы говорите боту, что собирать и, что не менее важно, что не собирать. Промпт ниже задаёт роль, ограничивает поиск публичными бизнес-данными, называет точные поля и категорически запрещает персональные данные. Используйте его как системную инструкцию и вставьте в новый разговор.
You are an AI sales bot. You use the Crawlbase Web MCP to gather PUBLIC business data only and to draft outreach. Rules: - Collect only data a company publishes publicly: company name, website, listed industry, public description, and the generic contact email on the site (e.g. sales@, hello@, info@). - Do NOT collect personal data about named individuals. - Do NOT guess or pattern-build emails. Use only what is published. - If a field is not public, leave it blank rather than inferring it. For each company, return a row with: Company Name, Website, Contact Email, Industry, Description, and a 2-sentence draft outreach note referencing something specific from their site.
Две строки "do NOT" выполняют реальную работу. Они удерживают бота на опубликованных данных уровня компании и не дают ему изобретать адреса, что является одновременно проблемой точности и этики. Когда роль установлена, отправьте реальную цель в следующем сообщении.
Find 10 B2B SaaS companies in Singapore that offer CRM or marketing automation. For each, visit the company site and its public contact page, then fill in the row format above.
Web MCP даёт вашему ассистенту живой доступ к вебу за одну установку. Он рендерит JavaScript-страницы, справляется с распространёнными блокировками и возвращает чистый контент для чтения моделью, поэтому ваш бот для продаж извлекает реальные, актуальные публичные данные о компаниях без необходимости запускать краулер или прокси-пул. Начните с бесплатного тарифа и сначала укажите на несколько публичных сайтов.
Шаг 4: Пусть бот краулит и составляет черновики
Получив бриф и цель, бот планирует свою работу. Он определяет компании-кандидаты, вызывает инструмент краулинга MCP на публичном сайте и контактной странице каждой компании, читает возвращаемый контент и заполняет заданный формат строки. Поскольку модель видит реальный текст страницы, составляемое ею сообщение для охвата может ссылаться на что-то конкретное: линейку продуктов, недавний запуск, заявленный фокус, а не на шаблонный заполнитель.
Усечённый пример того, что возвращается:
[ { "companyName": "Acme CRM", "website": "https://acmecrm.example", "contactEmail": "[email protected]", "industry": "B2B SaaS / CRM", "description": "Pipeline and contact management for SMB teams.", "draftNote": "Saw your pipeline-automation focus for SMB teams..." } ]
Попросите бота отрендерить те же данные в виде CSV, и вы сможете вставить их прямо в таблицу или импорт CRM. Черновик сообщения остаётся черновиком: отправной точкой для редактирования, а не сообщением для немедленной отправки.
Шаг 5: Уточнение цикла
Первый запуск редко бывает финальным. Несколько небольших добавлений делают бота значительно полезнее на практике, и каждое из них, это однострочное уточнение в чате, а не новый код.
Проверяйте перед тем, как доверять
Не каждый опубликованный адрес отслеживается, и качество общих входящих ящиков варьируется. Попросите бота отмечать строки, где контактный email выглядит как catch-all или контактная страница отсутствовала, чтобы вы могли приоритизировать чистые. Это ворота качества, а не обогащение персональными данными.
Дедуплицируйте между запусками
Запускайте бота несколько раз с пересекающимися критериями, и одна и та же компания появляется дважды, иногда под немного разными названиями. Заставьте его сравнивать домены и объединять дубликаты перед возвратом таблицы. Это поддерживает список в порядке и не даёт вам связаться с одной компанией дважды.
Настраивайте таргетинг
Вся система, просто промпт, поэтому перенацелить её можно одним предложением. Замените отрасль, регион или нишу, и бот адаптируется. Чем конкретнее бриф, тем релевантнее результаты, поэтому склоняйтесь к точным запросам вроде "финтех-компании в Канаде, предлагающие кредитование или платежи", а не к широким. Для более продвинутых многошаговых сценариев статья построение рабочих процессов AI-агентов с Crawlbase Web MCP идёт дальше одного промпта.
Место этого инструмента в реальном стеке продаж
Бот вроде этого, не замена CRM или инструменту для последовательностей; это исследовательский фронтенд, питающий их. Он превращает "составь мне список" из послеполуденного сёрфинга по вкладкам в разговор и поддерживает данные свежими, потому что каждый запуск загружает живые страницы, а не переиспользует устаревший экспорт. Если вы взвешиваете управляемый веб-доступ против создания собственного прокси-уровня, статья сценарии использования AI-прокси объясняет, где каждый подход оправдывает себя.
Стоит держать в уме одну мысль: опубликованные отраслевые данные о времени исследования лидов сильно варьируются и легко используются для вырванных из контекста утверждений, поэтому относитесь к любому заявлению "экономит X часов", включая то, которое вы могли бы сделать внутри компании, как к ориентировочному, а не точному. Реальный выигрыш, в единообразии: бот собирает одни и те же поля одним и тем же способом каждый раз, что на практике труднее делать вручную, чем кажется.
Честная часть: условия использования и персональные данные
Сбор бизнес-данных с публичных сайтов находится в серой зоне, и допустимость конкретного запуска зависит от условий использования каждого сайта, вашей юрисдикции и того, что вы делаете с данными. Многие сайты ограничивают автоматический доступ в своих условиях, поэтому краулинг может нарушать эти условия вне зависимости от того, насколько аккуратен ваш инструментарий. MCP делает техническую часть работающей; он не меняет правила, в рамках которых вы работаете.
Несколько принципов, которых стоит придерживаться. Собирайте только публичные данные уровня компании: названия, сайты, указанные отрасли и общие контактные адреса, которые бизнес публикует для входящих запросов. Не собирайте персональные данные об отдельных людях, не строите и не угадывайте email-адреса и не извлекайте ничего из-за стены авторизации. Уважайте robots.txt каждого сайта и заявленные ожидания относительно частоты запросов, держите объём запросов достаточно низким, чтобы не нагружать серверы. При отправке охвата соблюдайте применимые законы о борьбе со спамом, давайте людям чёткий способ отписаться и соблюдайте его.
Это руководство намеренно ограничено публичными бизнес-данными, потому что именно эта граница делает работу защищённой. Если вашему проекту нужны более богатые контактные данные, правильное решение, источник с согласия или официальный провайдер, а не более умный краулер. Тот же управляемый доступ, который лежит в основе Web MCP, Crawling API, AI Proxy и Crawling API, создан для ответственного сбора публичных данных, а не для обхода согласия.
Ключевые выводы
- Два компонента, один бот. Claude рассуждает и планирует; Crawlbase Web MCP загружает и рендерит живые страницы. Вместе они исследуют и составляют черновики для охвата без кода скрейпинга.
- Установка, это конфигурация, не код. Добавьте сервер Crawlbase в конфигурацию MCP-клиента с обычным и JS-токенами, перезапустите и подтвердите работу инструментов.
- Промпт, это продукт. Установите роль, ограничьтесь публичными данными, назовите поля и запретите персональные данные. Перенацеливание, это однопредложенное уточнение.
- JS-токен для рендеренных сайтов. Используйте обычный токен для статических страниц и JS-токен, когда контент загружается на клиенте.
- Оставайтесь на публичных данных уровня компании. Никакого контента за стеной авторизации, никаких угаданных email-адресов, никаких персональных данных об отдельных людях. Уважайте условия использования, robots.txt и законы о борьбе со спамом.
Часто задаваемые вопросы
Что такое AI-бот для продаж, построенный на Crawlbase Web MCP?
Это ассистент, объединяющий рассуждение языковой модели с живым веб-доступом Crawlbase Web MCP. Вы описываете идеальный профиль клиента, модель планирует поиск и вызывает инструменты MCP для краулинга публичных сайтов компаний, и возвращает структурированные лиды плюс черновики текстов для охвата без необходимости писать скрейпер или запускать прокси-пул.
Нужно ли писать код для создания этого?
Нет. Разработка состоит из записи конфигурации плюс промптов. Вы добавляете сервер Crawlbase в конфигурацию MCP-клиента с вашими токенами, перезапускаете, затем даёте боту промпт роли и цель. Модель выполняет краулинг и форматирование через инструменты MCP.
Использовать обычный токен или JS-токен?
Оба. Добавьте оба в конфигурацию и позвольте боту выбирать по странице. Обычный токен загружает статический HTML и быстрее; JS-токен сначала рендерит страницу в настоящем браузере и нужен для сайтов, строящих контент с помощью JavaScript. Если страница возвращается тонкой или пустой, переключите этот запрос на JS-токен.
Может ли бот найти личные email-адреса конкретных людей?
Не должен, и это руководство запрещает ему это. Промпт ограничивает сбор публичными данными уровня компании, такими как общие контактные адреса (sales@, hello@, info@), и запрещает угадывать или строить шаблоны личных email-адресов. Сбор или вывод данных об отдельных людях намеренно выходит за рамки как с точки зрения точности, так и с точки зрения соответствия требованиям.
Насколько точны данные, возвращаемые ботом?
Настолько точны, насколько точны страницы, которые он читает, именно поэтому промпт предписывает оставлять поле пустым, а не делать вывод. Публичные сайты могут быть устаревшими или противоречивыми, поэтому добавьте этап проверки: попросите бота отмечать отсутствующие контактные страницы или catch-all адреса и проверяйте строки перед любым охватом. Черновые сообщения воспринимайте как отправные точки для редактирования, а не как готовые тексты.
Законно ли использовать такого бота для генерации лидов?
Это зависит от условий использования каждого сайта, вашей юрисдикции и вашей цели, и многие сайты ограничивают автоматический доступ. Строго придерживайтесь публичных данных уровня компании, уважайте robots.txt и ожидания относительно частоты запросов и никогда не собирайте персональные данные или контент за стеной авторизации. При отправке охвата соблюдайте применимые законы о борьбе со спамом и предоставляйте чёткую возможность отписаться. Для более богатых контактных данных используйте источник с согласия, а не более агрессивный краулер.
Обходите любой сайт в масштабе, без борьбы с инфраструктурой.
Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

