Не так давно хранение файлов означало ящик с внешними дисками и молитву о том, чтобы ни один из них не вышел из строя. Затем Google Drive, Dropbox и волна аналогичных сервисов перенесли эти данные в интернет, и внезапно к ним можно было получить доступ с любого устройства, откуда угодно, не владея ни одним диском. Этот сдвиг и есть облачное хранилище, которое теперь лежит в основе всего: от семейных фотоальбомов до конвейеров данных петабайтного масштаба.

В этой статье облачное хранилище определяется доступным языком, объясняется, как оно реально работает под капотом, а затем рассматриваются основные типы, между которыми вам предстоит выбирать: форматы хранения (объектное, блочное и файловое) и модели развёртывания (публичное, частное, гибридное и общественное). После этого рассматриваются реальные сценарии использования, включая хранение скрейпированных датасетов, чтобы вы могли выбрать форму, соответствующую вашей рабочей нагрузке.

Что такое облачное хранилище?

Облачное хранилище является частью облачных вычислений, в которой ваши данные и файлы хранятся на серверах, доступных через интернет, а не на принадлежащем вам оборудовании. Сторонний провайдер размещает, управляет и защищает эти серверы, а вы обращаетесь к своим данным с любого подключённого устройства. Проще говоря, это хранилище в интернете.

Поскольку провайдер управляет инфраструктурой, вам не нужно покупать, устанавливать в стойки и обслуживать диски самостоятельно. Вы платите только за используемую ёмкость и запросы, что делает облако экономичнее по сравнению с собственным хранилищем. Малому бизнесу не нужно заранее закупать большой массив: он соразмеряет хранилище с реальными потребностями в данных, резервировании и резервном копировании и масштабирует его по мере роста. Та же эластичность позволяет как небольшой команде, так и глобальному предприятию работать по одной модели, платя только за то, что потребляют.

Практический результат прост. Ваши данные надёжны, доступны и достижимы в любое время, из любого места, с любого устройства без необходимости управлять машинами, которые их хранят.

Как работает облачное хранилище

Облачное хранилище работает, сохраняя ваши данные на серверах в дата-центрах провайдера. Когда вы загружаете файл, облачный сервис не помещает его на одну машину. Он пересылает копии на несколько виртуальных серверов, расположенных в разных физических местах. Именно это репликация является причиной того, что данные переживают плановое обслуживание, перебои питания и даже региональные катастрофы: если один узел выходит из строя, другой по-прежнему обслуживает ваши данные.

Когда ваши потребности в хранилище растут, провайдер запускает дополнительные виртуальные серверы для поглощения нагрузки, поэтому вы никогда не упираетесь в жёсткий предел, как при использовании собственного оборудования. Взамен вы отдаёте большую часть повседневного контроля. Провайдер берёт на себя ответственность за ёмкость, надёжность, безопасность и доставку данных, а вы получаете простой интерфейс для записи и чтения. Этот обмен, меньше контроля в обмен на большую масштабируемость и надёжность, является основной сделкой облака.

Три формы одной идеи. Объектное хранилище содержит целые файлы как объекты с богатыми метаданными в плоских бакетах, блочное разбивает данные на тома фиксированного размера для быстрого произвольного доступа, а файловое сохраняет привычную иерархию папок. Это одни и те же данные, организованные по-разному, и каждый тип лучше всего подходит для определённой задачи.

Типы облачного хранилища по формату

Прежде чем переходить к модели развёртывания, первое, что необходимо понять,, как данные организованы на диске. Существует три формата хранения, и большинство провайдеров предлагают все три, поскольку каждый подходит для определённого паттерна доступа.

Объектное хранилище

Объектное хранилище держит каждый файл как самодостаточный объект, объединённый с уникальным идентификатором и слоем метаданных, в плоском пространстве имён, называемом бакетом. Папок здесь нет; вы обращаетесь к объекту напрямую по его ключу. На этом принципе работают такие сервисы, как Amazon S3, Google Cloud Storage и Azure Blob, и они масштабируются практически без ограничений. Лучше всего подходит для больших объёмов неструктурированных данных, которые вы записываете один раз и читаете позже: резервные копии, медиафайлы, журналы, сканированные веб-страницы или разобранные датасеты. Метаданные и плоская структура упрощают управление миллиардами объектов без замедления из-за дерева каталогов.

Блочное хранилище

Блочное хранилище разбивает данные на блоки фиксированного размера, каждый со своим адресом, и представляет их как необработанный том, который сервер воспринимает как локальный диск. Поскольку любой блок можно считать или записать напрямую, оно обеспечивает низкозадержный произвольный доступ, именно поэтому оно лежит под базами данных, транзакционными системами и загрузочными томами виртуальных машин. Лучше всего подходит для рабочих нагрузок, требующих быстрой и стабильной производительности чтения-записи при изменяющихся данных, где приложение, а не слой хранилища, определяет, как организованы файлы.

Файловое хранилище

Файловое хранилище организует данные так же, как рабочий стол: иерархия папок и подпапок, доступная через стандартные сетевые файловые протоколы. Это наиболее знакомая модель и самая простая для совместного использования командами, поскольку каждый перемещается по одному дереву каталогов. Лучше всего подходит для общих документов, домашних каталогов и приложений, которые ожидают традиционного пути к файлу. Когда нескольким людям или системам нужно читать и записывать одни и те же файлы через общую структуру, файловое хранилище является естественным выбором.

Типы облачного хранилища по модели развёртывания

Вторая ось: кто владеет базовой инфраструктурой и совместно её использует. Классические четыре типа по-прежнему актуальны: публичное, частное, гибридное и общественное. Каждый по-своему балансирует стоимость, контроль и безопасность.

Публичное облако

Публичное облачное хранилище работает на общей инфраструктуре стороннего провайдера, мощности которого сдаются в аренду многим клиентам. Оно экономично, легко масштабируется, гибко и надёжно, с встроенной высокой доступностью. Компромисс, меньший прямой контроль над данными и вариабельность производительности, присущая общим ресурсам. Лучше всего подходит для обмена файлами, резервного копирования и восстановления, а также архивирования данных, где охват и эластичность важнее владения оборудованием.

Частное облако

Частное облачное хранилище предназначено для одной организации: размещается локально или у провайдера, но только для этого клиента. Оно обеспечивает высокую безопасность, жёсткий контроль над данными, высокую производительность и широкие возможности кастомизации. Стоимость выше, и вы берёте на себя больше ответственности за обслуживание и масштабирование. Лучше всего подходит для организаций с соответствующим бюджетом, имеющих конфиденциальные или регулируемые данные, собственные дата-центры и хостинг приложений для интеграции.

Гибридное облако

Гибридное облачное хранилище сочетает публичное и частное, позволяя бизнесу решать, где должны храниться отдельные части данных. Конфиденциальные записи могут оставаться в частном уровне, тогда как объёмные или пиковые рабочие нагрузки выполняются на публичном, что обеспечивает гибкость, масштабируемость и более высокую экономическую эффективность при сохранении безопасности там, где это важно. Недостаток, сложность: интеграция двух сред несёт накладные расходы на совместимость и управление. Лучше всего подходит для аварийного восстановления, резервного копирования и архивирования данных в обоих мирах.

Общественное облако

Общественное облачное хранилище : это совместно используемая инфраструктура нескольких организаций с общими требованиями, такими как одинаковые нормативные акты или отрасль. Разделение затрат между участниками делает его экономичным, при этом предлагая разумный уровень безопасности и кастомизации. Оно менее распространено и медленнее внедряется, и подойдёт не всем. Лучше всего подходит для секторов, сотрудничающих в рамках общих правил: здравоохранения, финансов и образования, где родственные организации извлекают выгоду из общей соответствующей требованиям платформы.

Для более детального рассмотрения того, где каждый тип расположен относительно хранения данных на собственном оборудовании, наша статья об облачном хранилище против локального подробно описывает компромиссы по стоимости, доступу и надёжности.

Реальные сценарии использования облачного хранилища

Облачное хранилище изменило способы сохранения, просмотра и управления данными, и его значимость продолжает расти вместе с объёмом цифровой информации и спросом на удалённый доступ. Помимо того, что оно просто дешевле, чем содержать собственное оборудование, оно лежит в основе нескольких конкретных рабочих нагрузок.

Резервное копирование и архивирование

Наиболее распространённый сценарий, хранение надёжной внеплощадочной копии данных. Поскольку провайдеры автоматически реплицируют данные в нескольких местах, резервная копия в облаке переживает сбой, который уничтожил бы один локальный диск. Редко используемые холодные архивы дёшево хранятся в объектном хранилище, а история версий означает, что можно восстановить более раннее состояние файла, а не только его последнюю версию.

Хранение и доставка медиаконтента

Фотографии, видео и аудио занимают много места и должны быстро доставляться пользователям откуда угодно. Объектное хранилище надёжно хранит оригиналы, а провайдеры дополняют его сетями доставки контента, поэтому одни и те же медиафайлы воспроизводятся и на телефоне в одной стране, и в браузере в другой без необходимости содержать серверы. Перенос файлов с разрозненных устройств и объединение их в одну организованную коллекцию : это повседневный сценарий как для потребителей, так и для предприятий.

Большие данные и аналитика

Аналитике нужно единое масштабируемое место для приземления сырых и обработанных данных, и облако это обеспечивает. Команды собирают большие датасеты в объектном хранилище, затем направляют на него хранилища данных, движки запросов и инструменты отчётности. Поскольку ёмкость растёт по требованию, датасет, удвоившийся за ночь, не требует закупки оборудования, что делает облако стандартной основой для работы с большими данными.

Данные приложений и совместная работа

Приложения используют облако как рабочий слой данных: хранят пользовательский контент, синхронизируют его между устройствами и обеспечивают актуальность общего файла для всех. Совместная работа в реальном времени, когда несколько человек редактируют один документ одновременно, зависит от этого, как и удалённые команды, опирающиеся на встроенный обмен, доступ к файлам и историю изменений для слаженной работы. Провайдер обеспечивает, чтобы каждый видел одну и ту же актуальную версию.

Хранение скрейпированных датасетов

Для тех, кто запускает конвейер веб-скрейпинга, облако является естественным домом для результатов краулинга. Скрейпированные данные растут ежедневно, повторно запрашиваются парсерами и аналитиками и обычно должны быть доступны всей команде или переданы на следующий этап конвейера. Объектное хранилище держит снимки сырого HTML и разобранные записи надёжными и готовыми к запросам, а эластичная ёмкость поглощает постоянно расширяющийся краул. Хранение канонической копии в одном месте означает, что каждый потребитель ниже по конвейеру, будь то задача обучения модели или дашборд, читает из одного источника, а не из разрозненного набора локальных файлов.

Crawlbase Crawling API

Когда краул выходит на большие объёмы, сложная часть, приземление всех этих данных в надёжное место без необходимости следить за дисками. Crawlbase Crawling API и асинхронный Crawler берут на себя загрузку, рендеринг и ротацию, затем доставляют скрейпированные страницы прямо в управляемое хранилище по мере выполнения задания, поэтому результаты накапливаются в одном готовом к запросам месте, а не в разрозненных файлах, которые нужно самостоятельно резервировать.

Если вы встраиваете скрейпированные данные в более крупную систему, полезно проектировать поток от начала до конца. Наш гид по построению масштабируемого конвейера веб-данных и руководство по архитектуре конвейера данных описывают место каждого уровня хранилища, а статья о том, как прокси улучшают безопасность и конфиденциальность данных, стоит прочтения, если собираемые вами данные являются чувствительными.

Итоги

Ключевые выводы

  • Облачное хранилище : это данные на серверах провайдера, доступные через интернет. Вы платите за то, что используете, и не нужно владеть оборудованием.
  • Оно работает путём репликации данных между несколькими площадками. Именно это резервирование обеспечивает надёжность при сбоях и катастрофах.
  • Три формата по-разному организуют данные. Объектное хранилище для неструктурированного объёма, блочное для быстрого произвольного доступа, файловое для общих иерархий.
  • Четыре модели развёртывания обменивают стоимость на контроль. Публичное для масштаба, частное для контроля, гибридное для обоих, общественное для секторов с общими правилами.
  • Скрейпированные датасеты принадлежат облаку. Объектное хранилище держит постоянно растущий, готовый к запросам вывод краулинга в одном надёжном месте для каждого потребителя ниже по конвейеру.

Часто задаваемые вопросы

Что такое облачное хранилище простыми словами?

Облачное хранилище означает хранение файлов на серверах провайдера, доступных через интернет, а не на принадлежащем вам диске. Провайдер отвечает за диски, репликацию и доступность, а вы обращаетесь к своим данным с любого подключённого устройства. Вы платите только за используемую ёмкость и запросы.

Какие основные типы облачного хранилища?

Есть два способа классификации. По формату: объектное хранилище для неструктурированных данных, блочное для быстрого произвольного доступа и файловое для общих иерархий папок. По модели развёртывания: публичное, частное, гибридное и общественное облако, которые различаются тем, кто владеет и совместно использует инфраструктуру.

В чём разница между объектным, блочным и файловым хранилищем?

Объектное хранилище держит целые файлы как объекты с метаданными в плоском бакете и масштабируется почти без ограничений, что подходит для резервных копий и медиафайлов. Блочное хранилище разбивает данные на тома фиксированного размера для низкозадержного произвольного доступа, что подходит для баз данных. Файловое хранилище использует иерархию папок через сетевые протоколы, что подходит для общих документов и традиционных приложений.

Безопасно ли облачное хранилище?

Крупные провайдеры предлагают шифрование данных в покое и при передаче, детальный контроль доступа и многофакторную аутентификацию, поэтому сами данные хорошо защищены. Постоянную озабоченность вызывает управление, а не техническая безопасность: допускают ли ваши правила передачу данных за пределы площадки вообще. Если нет, частная или гибридная модель сохраняет конфиденциальную часть под вашим контролем.

Подходит ли облачное хранилище для скрейпированных данных?

Да. Скрейпированные данные быстро растут, должны быть доступны для совместного использования и выигрывают от автоматического резервного копирования, всё это облако обеспечивает хорошо. Объектное хранилище держит сырой и разобранный вывод надёжным и готовым к запросам в одном месте, а эластичная ёмкость поглощает постоянно расширяющийся краул без закупки оборудования.

Сколько стоит облачное хранилище?

Вы платите за фактически используемые объём хранилища и активность запросов без предварительных затрат на оборудование, поэтому небольшая нагрузка обходится дёшево, а большая масштабируется по требованию. Для часто читаемых данных активность запросов и выгрузки может превысить стоимость хранения байт в покое, поэтому однократное хранение данных в чистом формате обычно дешевле, чем их повторная загрузка.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга