Большинство организаций сегодня располагает репозиторием данных, который значительно превышает возможности любой электронной таблицы: каждая транзакция, клик, поисковый запрос и обращение в поддержку оставляют след. Ценность заключается не в размере этого массива, а в том, что вы с ним делаете. Большие данные превращают эти следы в закономерности, а закономерности, в решения, которые прежде принимались только на основе интуиции.

В этой статье объясняется, что такое большие данные и почему они важны, а затем рассматриваются семь реальных примеров их применения в различных отраслях: маркетинг и реклама, банки и ценные бумаги, индустрия развлечений и СМИ, здравоохранение, образование, государственное управление и розничная торговля. Для каждой отрасли вы увидите, в чём состоит применение, как используются большие данные и какого результата это позволяет достичь. По завершении у вас будет конкретное представление о том, где большие данные уже приносят реальную пользу, а не просто абстрактное определение.

Что такое большие данные?

Большие данные описывают наборы данных, которые поступают с большим объёмом, с большей скоростью и в большем разнообразии, чем традиционные инструменты работы с данными способны обработать. Эти три свойства часто называют тремя «V». Наборы данных масштабны и сложны, нередко поступают из новых источников, таких как веб-страницы, датчики и журналы приложений, и превосходят возможности электронных таблиц и инструментов с одной базой данных, с которых начинало большинство команд.

Весь смысл такого масштаба, в рычаге влияния. Объёмы такого размера позволяют отвечать на вопросы, недоступные для небольших выборок: от прогнозирования спроса до обнаружения мошенничества в режиме реального времени. Чтобы их использовать, организации сочетают методы сбора, такие как веб-скрапинг, с надёжной основой в области обработки и анализа данных, чтобы сырой материал действительно превращался в аналитику, а не просто занимал место на хранилище. Построение такого потенциала вокруг чётких бизнес-целей, а не сбор данных ради самих данных, отличает полезную программу от дорогостоящей.

Одна основа, множество применений. Одна и та же основа больших данных (сбор, хранение и анализ) обеспечивает совершенно разные результаты в розничной торговле, финансах, здравоохранении, СМИ, государственном управлении и образовании.

Аналитика больших данных и её значение

Аналитика больших данных, это практика изучения крупных наборов данных для выявления информации, помогающей организациям принимать более взвешенные решения: скрытых закономерностей, корреляций, рыночных тенденций и предпочтений клиентов. Используя аналитические технологии и методы, команды исследуют данные и получают ответы на вопросы бизнес-аналитики, которые определяют планирование. На продвинутом уровне это включает прогностические модели, статистические алгоритмы и сценарный анализ, направленные в будущее, а не просто суммирующие прошлое.

Причина, по которой команды в неё инвестируют, результаты. При правильном применении аналитика больших данных обеспечивает несколько конкретных преимуществ:

  • Скорость из разных источников. Возможность анализировать большие объёмы данных из множества различных источников в различных форматах и типах за короткое время.
  • Лучшая стратегия. Улучшение процесса принятия решений благодаря более чёткому пониманию цепочек поставок, операционной деятельности и других аспектов стратегического планирования.
  • Снижение затрат. Повышение эффективности и оптимизация бизнес-процессов, которые переводятся в экономию.
  • Более точный маркетинг. Более сильные маркетинговые и продуктовые решения на основе глубокого понимания потребностей, поведения и настроений клиентов.
  • Умное управление рисками. Новые, более обоснованные стратегии управления рисками, которые стали возможны благодаря большим объёмам выборки.

С этой основой в голове остальная часть статьи конкретна. Вот семь отраслей, уже использующих большие данные, с реальными примерами в каждой.

1. Маркетинг и реклама

Маркетинг, это то место, где большинство людей впервые сталкиваются с большими данными, часто не осознавая этого. Каждая таргетированная реклама в социальной сети является результатом профиля, собранного из поведенческих данных. Два наиболее наглядных примера, стриминг и e-commerce.

Netflix

Netflix собирает информацию о каждом из своих многих миллионов подписчиков: что они смотрят, когда смотрят, какое устройство используют, ставят ли шоу на паузу, как быстро досматривают сериал и даже какие сцены пересматривают. Всё это питает настроенные пользовательские профили. Выигрыш двойной. Рекомендации становятся достаточно хорошими, чтобы удерживать людей у экрана, а те же данные влияют на то, какие шоу заказывать, так что решения о программировании основываются на наблюдаемом спросе, а не на догадках. Это также ранний пример данных нулевой стороны, когда клиенты добровольно делятся предпочтениями в обмен на фильмы и шоу, которые им с большей вероятностью понравятся.

Amazon

Amazon собирает сопоставимую глубину деталей: что пользователи покупают, как часто и как долго просматривают, оставляют ли отзывы, что питает анализ настроений. Из адреса для выставления счёта можно даже оценить доход. В совокупности по миллионам клиентов это создаёт высокосегментированные профили. Результат, предсказуемый таргетинг на основе поведения: предложения о том, что вы можете захотеть купить следующим, и группировки продуктов, которые подталкивают вас к более крупной и эффективной корзине.

2. Банки и ценные бумаги

В сфере финансов большие данные лежат в основе как надзора за рынком, так и самой торговли. Комиссия по ценным бумагам и биржам (SEC) использует подход больших данных для мониторинга рыночной активности, применяя сетевую аналитику и обработку естественного языка для выявления незаконной торговли. С другой стороны, высокочастотные трейдеры, банки, хедж-фонды и аналитики настроений опираются на большие данные для торговой аналитики, предторговой поддержки принятия решений, измерения настроений и прогностического моделирования.

Риск и соблюдение нормативных требований, другие активные пользователи. Системы противодействия отмыванию денег, управление рисками предприятия и проверки «Знай своего клиента» (KYC) зависят от обработки больших объёмов данных. Клиенты проходят через этапы верификации, такие как проверка документов, биометрическая аутентификация и мониторинг транзакций, а проверка AML распространяется на более широкую историю транзакций заявителя. Результат, более быстрое обнаружение подозрительной активности и защитимый след соответствия требованиям, и всё это в масштабе, недостижимом при ручной проверке.

3. Индустрия развлечений, СМИ и коммуникаций

Медиакомпании анализируют данные о клиентах и поведении совместно для создания детальных профилей аудитории, и они используют эти профили тремя способами: подбор различного контента для разных целевых аудиторий, рекомендация контента по запросу на основе предпочтений и измерение фактической эффективности контента.

Анализ настроений в режиме реального времени является одним из наиболее заметных применений. Во время Уимблдонского турнира большие данные используются для предоставления детального анализа настроений телезрителям, мобильным и веб-пользователям по мере разворачивания матчей. Spotify использует аналитику больших данных для обработки данных о прослушивании миллионов пользователей по всему миру и превращения их в обоснованные музыкальные рекомендации. Amazon Prime, объединяющий музыку, видео и книги, в значительной мере опирается на большие данные для координации этого каталога. Результат во всей отрасли одинаков: контент находит свою аудиторию, а рекомендации удерживают эту аудиторию вовлечённой.

4. Здравоохранение

Здравоохранение, возможно, та область, где большие данные имеют наибольшее значение, охватывая диагностику, лечение, профилактику и отслеживание заболеваний. Потенциал распространяется на фармацевтические компании и производителей медицинской продукции, а также больницы.

Электронные медицинские карты

Медицинские записи фиксируют демографические данные, семейный анамнез и особенности образа жизни. На бумаге эту информацию было трудно использовать. В оцифрованном виде в форме электронных медицинских карт (ЭМК) она становится значительно более ценной. В повседневной работе ЭМК напоминают клиницистам о необходимых проверках и предупреждают о рисках, например о необходимости проверки приёма лекарств. В масштабе исследователи могут коррелировать заболевания с образом жизни и окружающей средой, что информирует о новых вмешательствах и даже политике здравоохранения. Результат, более раннее выявление и более целенаправленное лечение.

Носимые устройства

Носимые устройства выводят мониторинг пациентов за пределы клиники и делают его непрерывным. Подключённый кардиомонитор позволяет врачу отслеживать артериальное давление дома, а не во время краткого больничного визита, поэтому проблема может быть обнаружена и устранена быстро. В совокупности по многим пациентам эти данные в реальном времени также помогают поставщикам медицинских услуг совершенствовать методы лечения и оценивать риски. Результат, говоря прямо, сэкономленные деньги и спасённые жизни.

Отслеживание заболеваний

Отслеживание заболеваний, это третье применение, и масштабные меры общественного здравоохранения продемонстрировали как его силу, так и противоречие с частной жизнью. Правительства создавали системы отслеживания контактов для замедления распространения инфекционных заболеваний, используя идентификационные данные для оповещения людей, которые могли подвергнуться воздействию, и другие сигналы для мониторинга соответствия. Возможности реальны, как и проблемы конфиденциальности, которые они поднимают, именно поэтому управление данными такого рода не менее важно, чем сама аналитика.

5. Образование

Образование долгое время рассматривало обучение как единый подход для всех. Большие данные изменили это, позволяя школам, колледжам и технологическим провайдерам персонализировать процесс. Выделяются три применения.

Снижение уровня отсева

Университет Purdue стал ранним последователем с системой Signals, инструментом раннего вмешательства, предсказывающим академические и поведенческие проблемы. Применяя прогностическое моделирование к данным студентов (подготовка к занятиям и вовлечённость), система выявляет студентов группы риска и уведомляет как самих студентов, так и преподавателей, чтобы колледж мог вмешаться. В исследовании по нескольким курсам Signals вероятность отсева снизилась на 21%.

Улучшение учебного опыта

Британская компания Sparx создала приложение по математике для детей, которое улучшает обучение с помощью машинного обучения, персонализированного контента и аналитики. Адаптивный алгоритм использует банк из более чем 32 000 вопросов для предоставления каждому студенту наиболее релевантного контента на основе их предыдущих ответов. Обратная связь в реальном времени означает, что ошибки устраняются немедленно, а обобщённые данные дают Sparx более широкое понимание того, как студенты учатся и где они испытывают затруднения.

Совершенствование методов преподавания

Другие провайдеры используют большие данные для повышения качества самого преподавания. Учителя начальной школы Roosevelt в Сан-Франциско используют аналитическое приложение DIBELS, которое предоставляет данные о привычках чтения студентов. Приложение показывает, где конкретным студентам нужна помощь, поэтому учителя могут направлять обучение туда, где агрегированные данные указывают на наибольшую необходимость, и размышлять о том, что работает. Результат, преподавание, руководствующееся доказательствами, а не средними показателями.

6. Государственное управление

Государственные службы применяют большие данные в широком спектре функций, включая геологоразведку нефти, анализ финансовых рынков, обнаружение мошенничества, медицинские исследования и защиту окружающей среды. Несколько конкретных программ иллюстрируют эту закономерность:

  • Администрация социального обеспечения. SSA использует аналитику неструктурированных данных для обработки больших объёмов заявлений о социальной инвалидности, включая медицинскую информацию, что ускоряет принятие решений и помогает выявлять подозрительные или мошеннические заявления.
  • Управление по санитарному надзору за качеством пищевых продуктов и медикаментов. FDA анализирует большие данные для выявления и изучения закономерностей заболеваний, связанных с пищевыми продуктами, что позволяет ускорить реагирование и снизить вред.
  • Министерство внутренней безопасности. DHS использует большие данные в целях национальной безопасности, анализируя данные, поступающие из множества агентств.

Пример FDA заслуживает более пристального внимания, поскольку он чётко демонстрирует аналитическую цель: исследуя закономерности и связи в крупных наборах данных, агентство может изучать как ожидаемые, так и неожиданные случаи заболеваний, передаваемых через продукты питания, и реагировать на них до дальнейшего распространения вспышки.

7. Розничная и оптовая торговля

Розничные и оптовые торговцы постоянно собирают большие данные из программ лояльности, систем торговых точек, складских запасов и местной демографии. Применения, представленные такими поставщиками, как Microsoft, Cisco и IBM, на крупных конференциях по розничной торговле, указывают на несколько повторяющихся вариантов использования:

  • Оптимизация персонала. Анализ моделей покупок, местных событий и связанных сигналов для обеспечения нужного количества персонала в нужное время.
  • Снижение мошенничества. Выявление аномальных транзакций до того, как они превратятся в убытки.
  • Своевременный анализ запасов. Поддержание запасов в соответствии с реальным спросом, а не прошлогодними прогнозами.

Социальные сети, это растущий рубеж больших данных в розничной торговле, даже для офлайн-магазинов: клиентов привлекают, удерживают и продвигают им товары через социальные каналы, а поведенческие данные, генерируемые этими каналами, напрямую поступают обратно в те же профили. Электронная коммерция является одним из богатейших источников таких данных, и наш гид по парсингу e-commerce описывает, как эти данные о продуктах и ценах собираются в масштабе.

Crawlbase Crawling API

Каждый из этих примеров начинается с данных, и большая часть наиболее ценных данных находится на публичных веб-страницах, которые противодействуют автоматизированному сбору. Crawlbase Crawling API берёт на себя рендеринг, ротацию IP и CAPTCHA, чтобы вы могли извлекать списки товаров, отзывы и рыночные сигналы в масштабе и передавать их в описанную выше аналитику. Вы получаете до 20 000 бесплатных запросов для старта и платите только за успешные.

Что объединяет эти примеры

Во всех семи отраслях повторяется одна и та же схема. Организация собирает данные из множества источников, нередко включая публичный веб. Она очищает и структурирует эти данные в удобную для использования форму. Затем она применяет аналитику, всё чаще прогностическую, чтобы превратить структурированные данные в решение: какое шоу заказать, какую транзакцию отметить, какому студенту помочь, какую полку пополнить.

Именно в этом конвейере заключается настоящая работа. Веб-скрапинг является распространённым первым шагом, поскольку так много внешних данных находится на страницах, предназначенных для людей, а не для машин. Необработанный экстракт затем нуждается в обработке, прежде чем стать полезным, что является предметом нашего руководства о том, как структурировать и очищать данные веб-скрапинга для ИИ и машинного обучения, а приведение данных к согласованной целевой структуре, задача моделирования данных. Когда данные очищены и смоделированы, аналитические инструменты берут управление, и наш обзор использования Python и pandas для анализа данных демонстрирует этот последний шаг на практике. Применения различаются по отраслям, но базовый жизненный цикл «собрать, структурировать, проанализировать, принять решение», нет.

Ответственный сбор данных

Большая часть внешних данных, лежащих в основе этих приложений, поступает из публичного веба, поэтому собирайте их ответственно. Соблюдайте условия использования и robots.txt каждого сайта, сосредоточьтесь на общедоступной информации и поддерживайте разумную частоту запросов, чтобы не ухудшать качество услуг, от которых зависите. Когда данные касаются личной информации, соблюдайте правила конфиденциальности, такие как GDPR и CCPA, и будьте обдуманны в том, что вы сохраняете. Примеры здравоохранения и отслеживания заболеваний выше напоминают о том, что возможности и ответственность должны развиваться вместе.

Итоги

Ключевые выводы

  • Большие данные, это про применение, а не про размер. Ценность заключается в превращении крупных, разнообразных, быстро меняющихся наборов данных в решения, а не в объёме собранных данных.
  • Маркетинг и розничная торговля работают на профилях. Netflix, Amazon и крупные ритейлеры создают поведенческие профили для поддержки рекомендаций, таргетинга, управления персоналом и запасами.
  • Финансы и государственное управление опираются на обнаружение аномалий. Аналитика выявляет незаконную торговлю, отмывание денег, мошеннические заявления и паттерны пищевых отравлений в масштабе, недостижимом при ручной проверке.
  • Здравоохранение и образование персонализируют результаты. ЭМК, носимые устройства и адаптивные обучающие приложения подстраивают лечение и обучение под конкретного человека с измеримыми результатами.
  • В основе всего лежит один жизненный цикл. Собрать, структурировать, проанализировать, принять решение; веб-скрапинг является распространённым первым шагом, а ответственный сбор, постоянным требованием.

Часто задаваемые вопросы

Что такое большие данные простыми словами?

Большие данные обозначают наборы данных, которые слишком велики, слишком быстро меняются или слишком разнообразны для обработки традиционными инструментами, что часто описывается как три «V»: объём (volume), скорость (velocity) и разнообразие (variety). Данные обычно поступают из новых источников, таких как веб-страницы, журналы приложений и датчики. Их ценность заключается не в самом размере, а в закономерностях и прогнозах, которые можно из них извлечь для принятия более взвешенных решений.

Каковы реальные примеры больших данных?

Распространённые примеры включают: Netflix и Amazon, создающие рекомендательные системы на основе поведенческих данных; SEC, отслеживающая рынки на предмет незаконной торговли; больницы, использующие электронные медицинские карты и носимые устройства; Purdue University, прогнозирующий отсев студентов; FDA, отслеживающее пищевые отравления; и ритейлеры, оптимизирующие штатное расписание и запасы. Одна и та же схема «собрать-структурировать-проанализировать» присутствует во всех этих случаях.

Как большие данные используются в маркетинге?

Маркетологи объединяют данные о просмотрах, покупках и вовлечённости в сегментированные профили клиентов, а затем используют прогностическую аналитику для таргетирования рекламы и рекомендации продуктов. Netflix использует данные о просмотрах для рекомендации контента и принятия решений о съёмках, тогда как Amazon использует историю покупок и просмотров для предложения следующих покупок и группировки продуктов для стимулирования более крупных корзин.

Как большие данные помогают здравоохранению?

Большие данные поддерживают диагностику, лечение, профилактику и отслеживание заболеваний. Электронные медицинские карты позволяют клиницистам выявлять корреляции между заболеваниями, образом жизни и окружающей средой, а также напоминать о своевременных проверках. Носимые устройства обеспечивают мониторинг в реальном времени вне клиники, чтобы проблемы обнаруживались на ранней стадии. На популяционном уровне аналитика агрегированных данных помогает совершенствовать методы лечения и информировать меры общественного здравоохранения.

Какую роль играет веб-скрапинг в работе с большими данными?

Большая часть внешних данных, лежащих в основе приложений больших данных, находится на публичных веб-страницах: от списков товаров и цен до отзывов и рыночных сигналов. Веб-скрапинг является распространённым первым шагом для сбора таких данных в масштабе. Необработанный экстракт затем очищается и структурируется, прежде чем аналитические инструменты превращают его в аналитику, именно поэтому скрапинг является входной точкой многих конвейеров больших данных.

Доступны ли большие данные только крупным компаниям?

Нет. Хотя заголовочные примеры исходят от крупных организаций, тот же жизненный цикл работает в любом масштабе. Облачная инфраструктура и управляемые инструменты сбора данных снизили барьер, чтобы небольшие команды могли собирать, структурировать и анализировать значимые наборы данных без создания всего с нуля. Важно иметь чёткий вопрос, на который нужно ответить, а не размер компании, которая его задаёт.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга