Когда вы пропускаете веб-страницу через сервис извлечения данных, вы одновременно доверяете ему две вещи: отправляемые запросы и всё, что возвращается в ответ. Это доверие держится лишь тогда, когда сервис чётко объясняет, что он хранит, чего никогда не касается и как ваш трафик защищён на протяжении всего пути. Безопасность и конфиденциальность, не функции, добавляемые задним числом. Это позиция, которую платформа занимает с первого запроса до последнего возвращённого байта.

В этой статье простым языком объясняется подход Crawlbase к безопасности данных и конфиденциальности для своих пользователей. Вы узнаете, что остаётся приватным, как данные защищены при передаче, где проходят границы в отношении персональных данных и как платформа согласована с такими нормативными актами, как GDPR и CCPA. Цель, дать вам чёткое, понятное представление об этой позиции, чтобы вы могли уверенно решить, подходит ли она для ваших задач.

Что здесь означают безопасность и конфиденциальность данных

Полезно разграничить два понятия, которые часто смешивают. Безопасность, это защита данных от несанкционированного доступа при их передаче и обработке. Конфиденциальность, это сдержанность: собирать как можно меньше, хранить как можно меньше времени и давать вам контроль над тем, что принадлежит вам. Платформа может быть технически безопасной и при этом небрежной в вопросах конфиденциальности, или осторожной в вопросах конфиденциальности, но слабой в защите. Заслуживающая доверия позиция требует обоих компонентов.

Для платформы веб-данных наиболее конфиденциальным материалом редко является адрес электронной почты вашего аккаунта. Это поток страниц, которые вы загружаете, и результаты, которые вы из них извлекаете. Именно здесь важна наиболее строгая сдержанность: чем меньше контента сервис хранит, тем меньше того, что вообще может быть раскрыто. Crawlbase твёрдо придерживается этого принципа: минимизировать то, что хранится, защищать то, что передаётся, и оставлять право собственности за вами. Наша сопровождающая статья о том, как прокси повышают безопасность данных и конфиденциальность, охватывает более широкий контекст того, почему это важно в работе со скрапингом.

Слои, а не единственная стена. Ваши данные защищены при передаче, хранятся только столько, сколько необходимо, и доступны только через контролируемый доступ.

Шифрование при передаче данных

Момент, который наиболее важно защитить, это когда данные находятся в движении, путешествуя между вашими системами и API. Crawlbase шифрует этот трафик с использованием стандартного транспортного шифрования (SSL/TLS), того же семейства протоколов, которое обеспечивает безопасность онлайн-банкинга и страниц оформления заказов. На практике это означает, что отправляемые запросы и получаемые ответы зашифрованы при передаче, поэтому никто, находящийся между вами и сервисом, не может тихо прочитать их или подменить.

Шифрование при передаче, это базовый уровень, которому должна соответствовать каждая уважающая себя платформа, и та часть позиции, которую вы можете проверить самостоятельно. Вызовы выполняются через HTTPS, а соединение защищено сквозным образом. Вам не нужно настраивать ничего особенного, чтобы это получить. Шифрование включено по умолчанию для каждого запроса, именно так и должен работать базовый уровень безопасности.

Минимальное хранение собранного контента

Ключевое решение в области конфиденциальности для платформы скрапинга, что происходит с контентом, который вы извлекаете. Crawlbase построен на принципе минимизации данных: он возвращает вам результаты вашего запроса и не хранит извлечённый контент дольше, чем необходимо для выполнения этого запроса. Ответ доставляется в ваши системы, и платформа не ведёт постоянную копию загружённых вами страниц.

Существует одно намеренное исключение, и вы сами его выбираете. Если вы подключаете Crawlbase Cloud Storage для хранения результатов, эти данные хранятся потому, что вы об этом попросили, в вашем аккаунте и под вашим управлением. За пределами функций, которые вы явно включаете, по умолчанию действует принцип сдержанности: доставить данные и не накапливать их. Преимущество этого умолчания легко объяснить. Контент, который платформа никогда не хранит, это контент, который в принципе не может быть раскрыт.

The short version

По умолчанию Crawlbase возвращает вам результаты краулинга и не хранит копию этого контента страниц. Хранение происходит только тогда, когда вы подключаете функцию хранения, и тогда данные остаются под вашим аккаунтом.

Данные вашего аккаунта и что в них не попадает

Для работы аккаунта платформе нужен небольшой объём информации о вас, например, адрес электронной почты, привязанный к вашему входу, и настройки аккаунта. Crawlbase намеренно держит этот след небольшим и обращается с ним как с конфиденциальным. Доступ к информации аккаунта ограничен уполномоченным персоналом и не передаётся по неосмотрительности и не используется в целях, выходящих за рамки предоставления сервиса, на который вы подписались.

Платёжные реквизиты, хороший пример проектирования с целью минимизации раскрытия. Crawlbase не собирает и не хранит ваши номера карт. Расчёты ведут проверенные поставщики платёжных услуг, такие как Stripe и Paddle, которые специализируются на защите этой информации и соответствуют отраслевым стандартам для неё. Ваша история транзакций и способы оплаты хранятся у этих поставщиков, а не в вашем аккаунте Crawlbase. Платформа никогда не видит необработанные данные карты, что означает одну категорию конфиденциальной информации меньше, которая когда-либо могла бы быть под угрозой с её стороны.

Контроль доступа простыми словами

Управление доступом отвечает на простой вопрос: кто что может видеть и при каких обстоятельствах. Понятная версия позиции Crawlbase проста. Ваш аккаунт доступен через ваши собственные учётные данные, привязанные к нему данные не открыты для других клиентов, а внутренний доступ к информации аккаунта ограничен авторизованным персоналом, которому он нужен для работы или поддержки сервиса, на условиях обязательств о конфиденциальности.

Это повседневный смысл «принципа наименьших привилегий» без жаргона. Люди и системы получают минимальный доступ, необходимый для выполнения задачи, и не более того. В сочетании с минимальным хранением это даёт простой и обнадёживающий результат: конфиденциального контента почти нет, а то немногое, что существует, недоступно широко. Принимать это на веру одного вам не придётся, поскольку следующий раздел охватывает нормативную базу, обязывающую платформу соблюдать эти обязательства.

Соответствие GDPR и CCPA

Два нормативных акта определяют подход ответственных платформ к обработке персональных данных. Общий регламент защиты данных (GDPR) в Европейском союзе и Закон Калифорнии о конфиденциальности потребителей (CCPA) в США основаны на одних и тех же идеях: собирать персональные данные законно и в чётко определённых целях, хранить только то, что необходимо, обеспечивать их безопасность и давать людям права в отношении их собственной информации. Crawlbase работает как компания, согласованная с GDPR и CCPA, что означает, что эти принципы встроены в подход к обращению с вашими данными, а не рассматриваются как второстепенные.

На практике согласованность выражается в справедливом и прозрачном сборе, сдержанности в том, что собирается, и уважении к вашему контролю над вашим аккаунтом и персональными данными. Опубликованная политика конфиденциальности платформы подробно излагает эти практики и является авторитетным местом для ознакомления с конкретными деталями. Если вопрос когда-либо сводится к точному обязательству, именно политика конфиденциальности, а не краткое изложение в блоге, является управляющим документом.

Crawlbase Crawling API

Позиция, описанная здесь, та же, что стоит за Crawlbase Crawling API. Он справляется с рендерингом, ротацией IP и CAPTCHA, позволяя надёжно собирать публичные веб-данные, при этом ваш трафик остаётся зашифрованным при передаче, а результаты возвращаются вам, а не накапливаются. Вы можете начать с лимита до 20 000 бесплатных запросов и платить только за успешные.

Ваши данные принадлежат вам

Право собственности, принцип, связывающий всё остальное воедино. Данные, которые вы извлекаете через Crawlbase, принадлежат вам. Платформа возвращает их вам для использования по потребностям вашего бизнеса, не претендует на долю в ваших результатах и не формирует незаметно собственный набор данных из вашей активности. Когда вы всё же решаете хранить результаты через Cloud Storage, это хранилище находится под вашим аккаунтом и вашим управлением: вы решаете, что хранить, а что удалять.

Это важно, поскольку ценность собранных данных заключается в том, что вы делаете с ними дальше: питаете аналитику, наполняете хранилище или обучаете модель. Платформа, рассматривающая ваши выходные данные как общий ресурс, подрывала бы эту ценность и вашу конфиденциальность одновременно. Позиция Crawlbase, противоположная. Вы собираете данные, вы ими владеете, вы контролируете, куда они идут. Практическое руководство о том, что делать с этими данными, когда они уже ваши, вы найдёте в нашей пошаговой инструкции по тому, как хранить собранные данные в облаке, и в наших заметках о том, как структурировать и очищать данные веб-скрапинга для AI и ML.

Анонимность при извлечении данных

Конфиденциальность на уровне платформы распространяется также на то, как ваши запросы достигают целевого сайта. Когда вы маршрутизируете трафик через Crawlbase, прокси-сеть платформы находится между вами и сайтом, с которого вы собираете данные. Ваш реальный IP-адрес и местоположение не раскрываются цели, что исключает тривиальную привязку вашей деятельности по сбору данных к вам.

Ротация IP, часть той же картины. Циклически меняя большой пул адресов, платформа делает масштабные сборы данных более надёжными и менее подверженными блокировкам, сохраняя при этом анонимность запрашивающей стороны для конечного получателя. В результате получается дополнительный слой операционной конфиденциальности поверх уже рассмотренных методов шифрования и хранения. Если предотвращение блокировок является постоянной проблемой в вашей работе, наше руководство о том, как парсить сайты без блокировок, углублённо рассматривает соответствующие техники, а наш материал о ротации IP-адресов объясняет, почему ротация работает.

Ответственный скрапинг

Безопасная платформа, лишь половина надёжной практики работы с данными. Другая половина, то, как вы её используете. Ответственный скрапинг означает уважение к условиям использования каждого сайта и его robots.txt, фокус на публично доступной информации, а не на контенте за логинами или платными барьерами, и поддержание разумной частоты запросов, чтобы не перегружать сайты, с которых вы собираете данные. Когда собираемые вами данные включают персональную информацию об отдельных лицах, обращайтесь с ними с той же осторожностью, которую ожидают эти нормативные акты: собирайте только то, что вам действительно нужно, обеспечьте безопасность и обращайтесь законно. Качественные инструменты упрощают ответственный сбор данных, но ответственность за то, как используются данные, остаётся за вами.

Итоги

Ключевые выводы

  • Шифрование, базовый уровень. Трафик между вами и Crawlbase передаётся через стандартное транспортное шифрование (SSL/TLS), поэтому запросы и ответы защищены при передаче по умолчанию.
  • Хранение минимально по замыслу. Извлечённый контент возвращается вам и по умолчанию не хранится платформой; хранение происходит только тогда, когда вы подключаете соответствующую функцию, например Cloud Storage, под вашим аккаунтом.
  • Конфиденциальные данные не попадают на платформу. Платёжные реквизиты обрабатываются такими поставщиками, как Stripe и Paddle, поэтому данные карты никогда не хранятся в вашем аккаунте Crawlbase.
  • Доступ ограничен и согласован с нормативными требованиями. Данные аккаунта доступны через ваши собственные учётные данные, внутри ограничены авторизованным персоналом и обрабатываются в соответствии с GDPR и CCPA.
  • Данные принадлежат вам. Результаты, которые вы извлекаете, предназначены для использования, хранения и управления вами; платформа возвращает их, а не претендует на них или накапливает.

Часто задаваемые вопросы

Хранит ли Crawlbase данные, которые я скрапю?

По умолчанию, нет. Crawlbase доставляет результаты вашего запроса в ваши системы и не ведёт постоянную копию извлечённого контента. Единственное исключение, когда вы подключаете функцию хранения, например Cloud Storage: в этом случае данные хранятся потому, что вы об этом попросили, и остаются под вашим аккаунтом и вашим управлением.

Шифруется ли мой трафик?

Да. Данные, передаваемые между вашими системами и Crawlbase, зашифрованы с использованием стандартного транспортного шифрования (SSL/TLS), того же семейства протоколов, которое защищает онлайн-банкинг и оформление заказов. Запросы и ответы защищены при передаче, поэтому никто между вами и сервисом не может тихо прочитать или изменить их, и это включено по умолчанию для каждого запроса.

Обрабатывает ли Crawlbase мои платёжные данные?

Нет. Crawlbase не собирает и не хранит данные вашей карты. Расчёты ведут проверенные поставщики платёжных услуг, такие как Stripe и Paddle, которые специализируются на защите этой информации. Ваши способы оплаты и история транзакций хранятся у этих поставщиков, а не в вашем аккаунте Crawlbase, поэтому необработанные данные карты никогда не находятся на стороне платформы.

Соответствует ли Crawlbase требованиям GDPR и CCPA?

Crawlbase работает как компания, согласованная с GDPR и CCPA: она следует основным принципам, общим для обоих нормативных актов, законному и прозрачному сбору данных, сдержанности в том, что собирается, обеспечению безопасности и уважению вашего контроля над собственными данными. Опубликованная политика конфиденциальности является авторитетным источником конкретных обязательств и местом для проверки точных деталей.

Кому принадлежат извлекаемые мной данные?

Вы. Результаты, которые вы собираете через Crawlbase, предназначены для использования по мере необходимости вашей работы, и платформа возвращает их вам, не претендуя на долю в них и не формируя собственный набор данных из вашей активности. Если вы решаете хранить результаты через Cloud Storage, эти данные находятся под вашим аккаунтом: вы решаете, что хранить, а что удалять.

Скрывает ли Crawlbase мой IP-адрес при скрапинге?

Когда вы маршрутизируете трафик через Crawlbase, прокси-сеть платформы находится между вами и целевым сайтом, поэтому ваш реальный IP-адрес и местоположение не раскрываются этому сайту. Ротация IP циклически меняет большой пул адресов, чтобы масштабные сборы данных оставались надёжными при сохранении анонимности запрашивающей стороны для конечного получателя.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга