Продукт / Cloud Storage

Cloud Storage.
Каждое сканирование сохранено, ничего не запрашивается повторно.

Добавьте store=true к любому сканированию, и Crawlbase сохранит отрендеренную страницу, JSON и скриншоты в облаке.
Получайте по RID, выполняйте полнотекстовый поиск и обойдитесь без базы данных, бакета S3 и резервных копий.

0.5 credits per page per monthОдин флаг: store=trueПолнотекстовый поиск
Сбор и хранениеДоступ в любой моментсобрать любой URLstore=trueОблачное хранилищеХранениеИндексПоискПолучить по RIDПолнотекстовый поискСтраницы и снимкиGET /storageпоиск по сборамHTML и скриншотысобрано · сохранено в облако · 200
Записи в хранилище в реальном времени1.24M req/minПотоковая передача
200github.com/crawlbaseCA83ms
200github.com/crawlbaseSG148ms
301producthunt.com/posts/notionBR89ms
200producthunt.com/posts/notionGB217ms
200indeed.com/jobs?q=developerIN189ms
200producthunt.com/posts/notionJP192ms
200yelp.com/biz/blue-bottle-coffeeUS105ms
200booking.com/searchresults.html?ss=ParisFR71ms
200walmart.com/ip/55048794FR42ms
200google.com/search?q=web+scrapingFR113ms
301reddit.com/r/programmingJP49ms
200producthunt.com/posts/notionBR165ms
200reddit.com/r/programmingSG45ms
200github.com/crawlbaseDE191ms
200booking.com/searchresults.html?ss=ParisSG73ms
200indeed.com/jobs?q=developerSG146ms
200glassdoor.com/Reviews/index.htmES206ms
200tripadvisor.com/Restaurants-g60763BR62ms
200yelp.com/biz/blue-bottle-coffeeBR55ms
200walmart.com/ip/55048794AU204ms
200tripadvisor.com/Restaurants-g60763AU174ms
200github.com/crawlbaseUS191ms
200stackoverflow.com/questions/11227809AU97ms
200booking.com/searchresults.html?ss=ParisCA128ms
200indeed.com/jobs?q=developerDE96ms
200reddit.com/r/programmingFR117ms
200github.com/crawlbaseCA83ms
200github.com/crawlbaseSG148ms
301producthunt.com/posts/notionBR89ms
200producthunt.com/posts/notionGB217ms
200indeed.com/jobs?q=developerIN189ms
200producthunt.com/posts/notionJP192ms
200yelp.com/biz/blue-bottle-coffeeUS105ms
200booking.com/searchresults.html?ss=ParisFR71ms
200walmart.com/ip/55048794FR42ms
200google.com/search?q=web+scrapingFR113ms
301reddit.com/r/programmingJP49ms
200producthunt.com/posts/notionBR165ms
200reddit.com/r/programmingSG45ms
200github.com/crawlbaseDE191ms
200booking.com/searchresults.html?ss=ParisSG73ms
200indeed.com/jobs?q=developerSG146ms
200glassdoor.com/Reviews/index.htmES206ms
200tripadvisor.com/Restaurants-g60763BR62ms
200yelp.com/biz/blue-bottle-coffeeBR55ms
200walmart.com/ip/55048794AU204ms
200tripadvisor.com/Restaurants-g60763AU174ms
200github.com/crawlbaseUS191ms
200stackoverflow.com/questions/11227809AU97ms
200booking.com/searchresults.html?ss=ParisCA128ms
200indeed.com/jobs?q=developerDE96ms
200reddit.com/r/programmingFR117ms
01 Живая демонстрация

Сохраняйте одним флагом. Получайте по RID.

Cloud Storage, набранное вживую. Сохраните сканирование одним параметром, а затем получите его позже по его RID. Наведите курсор, чтобы приостановить и прочитать.

готово
клавиши 1-2 переключают · щёлкните для паузызапустите свой URL
Store your first crawl in minutes. Start free, no credit card.Начать бесплатно
02 Возможности

Хранилище, созданное для сканирований.

Сохраняйте, находите и загружайте собранные данные, не разворачивая собственное хранилище.

store

Сохранение одним флагом

Добавьте store=true к любому вызову Crawling API или направьте Crawler в облачное хранилище, и отрендеренная страница сохранится автоматически.

retrieve

Получение по RID

Каждое сохранённое сканирование получает RID. Отправьте GET-запрос с ним, и страница вернётся напрямую, без повторного сканирования.

search

Полнотекстовый поиск

Ищите по всему, что вы просканировали, чтобы найти именно нужные страницы, вместо того чтобы просматривать собственную базу данных.

capture

Страницы и скриншоты

Храните отрендеренный HTML, структурированный JSON и полностраничные скриншоты вместе, всё доступно по одному и тому же RID.

scale

Масштабирование берём на себя

Crawlbase управляет масштабированием, резервным копированием и очисткой вашего пространства, так что вы можете отказаться от бакета S3 и обслуживания.

pipe

Цель вебхука Crawler

Используйте хранилище как цель доставки для асинхронного Crawler, чтобы крупные сканирования приходили готовыми к загрузке.

03 Как это работает

Один флаг для сохранения, один вызов для загрузки.

Оставьте своё сканирование как есть. Добавьте параметр для сохранения и GET для получения.

01

Добавьте store=true

Сканируйте любой URL с store=true или задайте облачное хранилище как цель вебхука вашего Crawler.

02

Мы сохраняем и индексируем

Отрендеренная страница, JSON и скриншот сохраняются и индексируются для полнотекстового поиска, с масштабированием на нашей стороне.

03

Сохраните RID

В ответе возвращается RID хранилища, который однозначно идентифицирует только что сохранённую вами страницу.

04

Получайте или ищите

Отправьте GET на эндпоинт хранилища с RID, ищите по своим сканированиям или загружайте из консоли.

04 Сценарии использования

Что команды хранят в Cloud Storage.

USE / 01Конвейеры

Буфер для вашего стека

Размещайте просканированные страницы в хранилище и загружайте их в своё хранилище данных, индекс или модель по своему собственному расписанию.

USE / 02История

Снимки во времени

Сохраняйте каждое сканирование, чтобы сравнивать страницу за разные даты без повторного сканирования.

USE / 03Поиск

Поиск по вашим сканированиям

Выполняйте полнотекстовый поиск по всему сохранённому, чтобы найти именно нужные страницы и поля.

USE / 04Стоимость

Откажитесь от собственного хранилища

Уберите бакет S3 и базу данных. Хранилище масштабируется, делает резервные копии и очищается само.

USE / 05ИИ

Корпуса для обучения и RAG

Создавайте и заново загружайте большие, чистые наборы страниц для обучения и извлечения прямо из хранилища.

USE / 06Асинхронность

Доставка через Crawler

Сочетайте хранилище с Crawler, чтобы высоконагруженные асинхронные сканирования приходили готовыми к получению.

05 Pricing

One rate card, shared with every product.

Storage bills from the same balance as your crawls: half a credit keeps a page stored for a month, with no database to run.

Pay as you go$3.00 down to $0.02 per 1,000 successful requests

Only successful requests are billed, and rates fall as volume grows. Optional subscriptions from $99 / mo. Start free with up to 5,000 requests, no credit card.

06 Почему Crawlbase

Хранилище, которое вам не нужно обслуживать.

Cloud Storage работает в той же сети, что обслуживает более 70,000 разработчиков. Не нужно разворачивать S3, делать резервные копии базы данных или что-либо очищать, когда оно заполнится.

99%
Средняя доля успешных запросов
70K+
Клиентов в сети
0.5
Credits per stored page per month
99.99%
Время безотказной работы сети

Добавьте store=true один раз, и каждое сканирование будет сохранено, проиндексировано и готово к загрузке.

07 FAQ

Вопросы о Cloud Storage.

Масштабируемое облачное хранилище для ваших собранных и извлечённых данных. Добавьте store=true к сканированию, и отрендеренный HTML, JSON и скриншоты будут сохранены для вас, готовые к получению по RID или к поиску, без необходимости запускать собственную базу данных.
Добавьте store=true к вызову Crawling API или используйте Cloud Storage как цель вебхука для Crawler. В ответе возвращается RID хранилища, который идентифицирует сохранённую страницу.
Отправьте GET-запрос на эндпоинт хранилища с RID, выполните полнотекстовый поиск по сохранённым страницам или просматривайте и загружайте со страницы Storage в консоли.
Да. Сохранённые сканирования могут включать отрендеренный HTML, структурированный JSON и полностраничные скриншоты, всё доступно по одному и тому же RID.
Нет. Crawlbase берёт на себя масштабирование, резервное копирование и очистку вашего пространства хранилища, так что вы можете перестать обслуживать бакет S3 или собственную базу данных.
Storage draws on the same credit balance as your crawls: half a credit keeps a page stored for a month, and your free signup credits cover it to start. See the pricing page for how credits work.

Сохраняйте каждую страницу, которую сканируете.
Обойдитесь без базы данных.

Free to begin, no credit card. One balance across Cloud Storage and every product.