Каждое решение, которое команда принимает на основе дашборда, отчёта или модели, опирается на негласное допущение: что лежащие в основе данные достаточно надёжны. Метрики качества данных позволяют проверить это допущение, а не просто надеяться, что оно оправдается. Они превращают расплывчатое ощущение «что-то в цифрах не так» в конкретные, измеримые параметры, которые можно оценивать, отслеживать и улучшать.
В этом руководстве объясняется, что такое метрики качества данных и почему они важны, затем рассматриваются шесть параметров, определяющих качество данных (точность, полнота, согласованность, актуальность, корректность и уникальность), а также способы их измерения и улучшения. В завершение предложен практичный, воспроизводимый процесс применения этих метрик и рассмотрена роль веб-скрапинга. По окончании чтения вы сможете взглянуть на любой набор данных и с опорой на доказательства сказать, насколько он хорош на самом деле.
Что такое метрики качества данных?
Качество данных описывает, насколько данные точны, полны, надёжны и пригодны для конкретного использования. Метрики качества данных, это измеримые показатели, нередко рассматриваемые как ключевые показатели эффективности (KPI), которые говорят о том, насколько ценен и актуален набор данных и можно ли ему доверять. Они разграничивают утверждение «данные хорошие» и доказательство этого факта.
Оценка сама по себе, не конечная цель. Реальная ценность этих метрик состоит в том, что они позволяют разделить высококачественные данные и низкокачественные по конкретным, именованным критериям, чтобы вы точно знали, где набор данных силён, а где подводит. Вместо одного расплывчатого вердикта вы получаете профиль: возможно, данные точны и уникальны, но устарели и несогласованны между системами. Именно этот профиль подскажет, что исправлять в первую очередь.
Почему метрики качества данных важны
Низкое качество данных обходится дорого, и эту стоимость легко недооценить. Если некачественные данные служат основой для принятия решений, результатом становятся упущенные возможности, ошибочная стратегия и отрицательная отдача от зависящей от этого работы. Опросы специалистов по данным неизменно показывают, что подготовка и очистка данных, а не их анализ, занимают большую часть времени, именно потому, что качество нельзя принимать как должное. Руководители высшего звена ощущают это тоже: согласно широко цитируемым данным Forbes, большинство генеральных директоров выражали озабоченность качеством данных, на которых основываются их решения.
Когда с качеством всё в порядке, выгоды накапливаются. Надёжные, точные данные ведут к более качественным и быстрым решениям, снижению рисков, упрощению соблюдения регуляторных требований, снижению операционных затрат и повышению доверия со стороны тех, кто их использует, как внутри организации, так и за её пределами. Клиентоориентированные системы тоже улучшаются, поскольку актуальные и корректные записи о клиентах формируют лучший пользовательский опыт. Отслеживание этих параметров с помощью явных метрик превращает «нам нужны хорошие данные» в управляемое, улучшаемое свойство бизнеса, а не в дело случая.
Шесть измерений качества данных
Качество данных, не единственная цифра. Его обычно разбивают на шесть параметров, каждый из которых измеряет разные способы, которыми данные могут быть правильными или неправильными. Набор данных может хорошо показывать себя по одним параметрам и плохо по другим, именно поэтому измерять их по отдельности полезно. Разделы ниже рассматривают каждый параметр по очереди: что он измеряет, как его проверить и как его улучшить.
1. Точность
Точность измеряет, насколько данные отражают реальность: верны ли значения и насколько они точны? Это наиболее интуитивный параметр и зачастую наиболее сложный для проверки, поскольку требует сравнения ваших данных с истиной, которую они должны представлять. Точность легко деградирует, через устаревшие записи, ручной ввод данных или ошибки, возникшие при передаче данных между системами.
Для измерения точности проверяйте значения по надёжному эталонному источнику и используйте методы перекрёстной проверки для выявления несогласующихся записей. Для её улучшения сокращайте моменты, в которые закрадываются ошибки: автоматизируйте ввод там, где это возможно, добавляйте валидацию в точке захвата данных и обновляйте устаревшие записи по расписанию. В ответственных областях, здравоохранении и финансах, точность важна прежде всего, поскольку даже незначительная ошибка может иметь серьёзные последствия.
2. Полнота
Полнота измеряет, присутствуют ли все необходимые вам данные. Неполные данные нередко оказываются фактически бесполезными: запись о клиенте без номера телефона не может поддержать кампанию, зависящую от него. Полнота оценивается как на уровне записи, так и на уровне атрибута, и охватывает больше, чем очевидные пробелы. При её проверке учитывайте обязательные поля (например, номер телефона), необязательные поля (например, поле интересов) и релевантные поля для каждой конкретной записи.
Для измерения полноты вычисляйте процент отсутствующих значений в значимых полях и сравнивайте набор данных с заведомо полным образцом. Для её улучшения делайте обязательные поля незаполнимыми при вводе, при возможности дополняйте пробелы из вторичных источников и помечайте записи, не достигающие порога полноты, чтобы они не использовались молча как будто бы целые.
3. Согласованность
Согласованность измеряет, согласуются ли данные сами с собой в разных источниках и внутри одного набора данных. Поскольку организации теперь хранят ценные данные во многих системах и устройствах для защиты от потерь, один и тот же факт может существовать в нескольких местах, и эти копии могут расходиться. Данные согласованны, когда они одинаковы во всех них.
Несогласованность разрушительна: конфликтующие копии одной и той же записи вносят ошибки и противоречия, которые незаметно подрывают точность и надёжность всего нижестоящего. Для измерения согласованности сопоставляйте одни и те же сущности в разных источниках и ищите несовпадающие значения. Для её улучшения будьте бдительны в моменты возникновения несогласованности, при вводе, изменении и интеграции данных, а там, где это выполнимо, объединяйте данные в единую авторитетную систему, чтобы существовала только одна версия для доверия. Сопоставление записей из разных источников, самостоятельная дисциплина; наше руководство по сопоставлению данных веб-скрапинга подробно описывает используемые техники.
4. Своевременность
Актуальность измеряет, доступны ли данные и обновлены ли они в тот момент, когда они действительно нужны. Здесь есть тонкое, но важное различие между данными, которые обновлены, и данными, которые доступны. Данные могут быть совершенно свежими и при этом не пройти проверку на актуальность, если они недоступны в момент принятия решения. Несвоевременные данные, свежие, но недоступные, могут нанести ущерб как процессу принятия решений, так и репутации организации.
Для измерения актуальности отслеживайте разницу во времени между моментом сбора данных и моментом их появления, а также периодичность их обновления. Для её улучшения сокращайте конвейер между сбором и доступностью, автоматизируйте циклы обновления, чтобы данные не устаревали между ручными обновлениями, и согласовывайте частоту обновлений со скоростью изменения лежащей в основе реальности. Актуальность занимает центральное место в управлении базами данных: вопрос, на который она отвечает, присутствует ли требуемая информация в запрошенный момент времени.
5. Достоверность
Корректность измеряет, соответствуют ли данные правилам, форматам и стандартам, которым они должны следовать. Значение может присутствовать и даже быть верным по существу, но при этом быть некорректным, если оно нарушает заданный формат, например, дата в неправильной форме записи или код за пределами допустимого набора. Некорректные данные обычно возникают вследствие ошибок ввода из-за несогласованных форматов, сбора из ненадёжных источников или некорректного хранения или обработки данных. Будучи не выявленными, некорректные значения распространяются и также снижают полноту набора данных.
Для измерения корректности вычисляйте процент значений, нарушающих ваши правила, и проверяйте данные на соответствие бизнес-требованиям. Для её улучшения заранее определяйте явные правила формата и диапазонов, обеспечивайте их соблюдение в точке ввода, а не постфактум, и отклоняйте или помещайте в карантин записи, нарушающие их, до того как они попадут в системы, зависящие от чистых входных данных.
6. Уникальность
Уникальность измеряет, появляется ли каждая реальная сущность только один раз, без дублирующихся записей, завышающих ваши подсчёты или разбивающих одного клиента на несколько строк. Это жизненно важный параметр, поскольку дубликаты незаметно искажают точность: агрегированные показатели завышают реальность, а обновления, применённые к одной копии, оставляют остальные устаревшими. Дублирование, как правило, возникает из-за устаревших записей, сохраняющихся рядом с их заменами, или из-за многократного копирования данных при передачах.
Для измерения уникальности вычисляйте процент дублирующихся записей в наборе данных. Для её улучшения присваивайте стабильные уникальные идентификаторы, чтобы дубликаты можно было обнаруживать и объединять, и проводите дедупликацию регулярно, а не ожидая, когда дубликаты вызовут видимую проблему. Это происходит нечасто, но достаточно регулярно, чтобы уникальность заслуживала осознанного внимания.
Измерения качества данных кратко
Шесть параметров проще применять, когда можно видеть их бок о бок. В таблице ниже приведено краткое описание того, что измеряет каждый из них, и практический способ его проверки.
| Параметр | Что измеряет | Как проверить |
|---|---|---|
| Точность | Верны ли значения и насколько они точны | Перекрёстная проверка и сравнение с надёжным источником |
| Полнота | Присутствуют ли все необходимые данные | Измерение процента отсутствующих значений по сравнению с заведомо полным образцом |
| Согласованность | Согласуются ли данные между источниками и внутри них | Сопоставление одной и той же сущности в системах и пометка несовпадающих значений |
| Актуальность | Являются ли данные свежими и доступными в нужный момент | Отслеживание задержки между сбором и доступностью, а также частоты обновления |
| Корректность | Соответствуют ли данные заданным правилам и форматам | Измерение процента значений, нарушающих бизнес-правила |
| Уникальность | Появляется ли каждая сущность только один раз | Измерение процента дублирующихся записей |
Как применять метрики качества данных на практике
Знать параметры, одно, а выполнять их как постоянную дисциплину, совсем другое. Шаги ниже превращают метрики в воспроизводимый цикл. Это не разовый проект: поддержание качества данных, непрерывные усилия, поскольку данные и окружающий их бизнес постоянно меняются.
Задайте метрики качества данных
Начните с выбора метрик, важных для ваших целей. Каждый бизнес уникален, поэтому выберите параметры, полнота, точность, согласованность, актуальность, уникальность, корректность или их подмножество, соответствующие вашим задачам. Чёткие метрики помогают руководству предоставлять клиентам достоверные данные, выявлять утечки точности и определять неполные, некорректные или несогласованные записи до того, как они распространятся.
Установите правила качества данных
Для каждой выбранной метрики определите правило, решающее, что считать хорошим. Если полнота, одна из ваших метрик, правило может гласить, что каждое обязательное поле должно быть заполнено, чтобы запись считалась действительной. Правила устанавливают пороги, разделяющие высококачественные и низкокачественные данные, и дают всем общий стандарт. Для согласованности внутри организации каждая команда, работающая с данными, должна принять и применять одни и те же правила.
Разрабатывайте и запускайте тесты качества данных
Разработайте тесты, проверяющие данные на соответствие вашим правилам. В зависимости от сложности данных и правил они могут быть автоматизированными или ручными. Затем запустите их и зафиксируйте результат каждого теста, это один из лучших способов укрепить доверие к набору данных. При выполнении тестов следите за классическими признаками низкого качества: поля с незначительной или нулевой информацией, неточные или неполные значения, нерегулярное форматирование, избыточные элементы и устаревшие записи, требующие обновления. Проводите эти проверки регулярно, чтобы даже небольшие ошибки не оставались незамеченными.
Когда оцениваемые данные поступают из интернета, проблемы с качеством нередко начинаются ещё на этапе сбора: заблокированные запросы, неполные страницы и несогласованные извлечения напрямую влияют на точность, полноту и согласованность. Crawlbase Crawling API самостоятельно справляется с рендерингом, ротацией IP и решением CAPTCHA, возвращая полные страницы и взимая оплату только за успешные запросы, что означает более чистые входные данные ещё до запуска любых проверок качества.
Анализируйте результаты и улучшайте
После выполнения тестов проанализируйте результаты в сравнении с установленными правилами. Именно так измеряется реальное качество данных, и анализ нередко позволяет выяснить причины проблем, что указывает на способ их устранения. Используйте эти выводы для уточнения правил и повышения надёжности данных. Затем действуйте: исправьте найденные ошибки и, что не менее важно, измените практики, их породившие, будь то ужесточение ввода данных, пересмотр правил метрики или добавление новых для перехвата пропущенных сбоев. Предотвращение повторения одной и той же ошибки, вот что делает улучшение устойчивым.
Непрерывный мониторинг
Улучшение качества данных, не разовый процесс, а непрерывный путь. Непрерывно отслеживайте данные, чтобы убедиться, что они по-прежнему соответствуют установленным правилам, и регулярно пересматривайте сами правила, поскольку бизнес-среда меняется и вчерашние пороги могут больше не подходить. Непрерывный мониторинг даёт гибкость для корректировки до того, как качество ухудшится, и именно эта практика поддерживает долгосрочную надёжность набора данных. О формировании и валидации данных по мере их движения рассказывает наш материал о том, как структурировать и очищать данные веб-скрапинга, он охватывает этапы очистки, питающие эти проверки; наш обзор архитектуры конвейера данных показывает, где в общем потоке должны находиться контрольные точки качества.
Веб-скрапинг и качество данных
Веб-скрапинг, это автоматизированный сбор данных с веб-сайтов, применяемый в маркетинговых исследованиях, мониторинге цен и анализе данных. Поскольку многое в моделировании и анализе теперь зависит от данных, собранных из интернета, качество этого этапа сбора устанавливает верхнюю границу для всего последующего. Если страницы возвращаются заблокированными, неполными или с несогласованной структурой, полученный набор данных оказывается скомпрометированным по точности, полноте и согласованности ещё до того, как кто-то запустит хотя бы одну проверку качества.
Качественный инструментарий для сбора данных защищает эти параметры с самого начала. Мощный сервис скрапинга может по запросу извлекать полные, релевантные данные с комплексных сайтов, адаптироваться к изменениям на сайтах и самостоятельно справляться с парсерами, прокси и браузерами. Результат, более чистые входные данные, что означает меньше проблем с качеством в дальнейшем. Как только данные получены, те же шесть параметров применимы и к ним, а такие инструменты, как pandas, позволяют легко профилировать отсутствующие значения, дубликаты и выходящие за диапазон записи в рамках регулярных проверок.
Ответственный скрапинг
Качество и ответственность идут рука об руку. При сборе данных из интернета собирайте только публичные данные, уважайте условия использования каждого сайта и его директивы robots.txt, и поддерживайте разумную частоту запросов, чтобы не перегружать серверы, на которые вы опираетесь. Если данные касаются персональных сведений о людях, обращайтесь с ними в соответствии с такими нормами, как GDPR и CCPA. Ответственный сбор данных, это не только этическая основа; он также склонен давать более стабильные и согласованные данные, что напрямую улучшает их качество.
Ключевые выводы
- Метрики заменяют догадки. Метрики качества данных превращают расплывчатое ощущение неверных цифр в измеримые параметры, которые можно оценивать, отслеживать и улучшать.
- Шесть параметров определяют качество. Точность, полнота, согласованность, актуальность, корректность и уникальность, каждый отражает особый способ, которым данные могут быть правильными или неправильными, поэтому измеряйте их по отдельности.
- Каждый параметр имеет конкретную проверку. От перекрёстной проверки по надёжному источнику до подсчёта отсутствующих значений, дубликатов и нарушений правил, каждый параметр соответствует практическому измерению.
- Качество, непрерывный цикл. Установите метрики, определите правила, разработайте и выполните тесты, проанализируйте, улучшите, затем отслеживайте: данные и окружающий их бизнес постоянно меняются, поэтому работа никогда не заканчивается.
- Сбор задаёт верхнюю границу. Когда данные поступают из интернета, чистый и полный скрапинг защищает точность, полноту и согласованность ещё до запуска каких-либо проверок качества.
Часто задаваемые вопросы
Каковы шесть метрик качества данных?
Шесть параметров, наиболее часто используемых для измерения качества данных: точность (верны ли значения?), полнота (присутствуют ли все необходимые данные?), согласованность (согласуются ли данные между источниками и внутри них?), актуальность (являются ли данные свежими и доступными в нужный момент?), корректность (следуют ли они заданным правилам и форматам?) и уникальность (встречается ли каждая сущность только один раз?). Набор данных может хорошо показывать себя по одним параметрам и плохо по другим, именно поэтому каждый из них измеряется отдельно.
Как измерять качество данных?
Измерение проводится по каждому параметру. Точность проверяется перекрёстной валидацией по надёжному источнику; полнота, процентом отсутствующих значений; согласованность, сопоставлением одной и той же сущности в системах и пометкой расхождений; актуальность, задержкой между сбором и доступностью и частотой обновления; корректность, процентом значений, нарушающих бизнес-правила; уникальность, процентом дублирующихся записей. Вместе эти показатели дают профиль, а не единственную оценку.
Что такое метрический подход к качеству данных?
Подход на основе метрик анализирует несколько аспектов данных для формирования оценок качества, после чего управляет ими как непрерывным циклом. Шаги следующие: задать метрики качества данных, установить правила для каждой, разработать тесты, выполнить их и зафиксировать результаты, проанализировать результаты, улучшить данные и лежащие в основе практики, а затем непрерывно отслеживать, чтобы качество поддерживалось по мере изменения условий.
Почему качество данных важно для бизнеса?
Решения хороши ровно настолько, насколько хороши лежащие в их основе данные. Высококачественные данные ведут к более качественным и быстрым решениям, снижению рисков, упрощению соблюдения регуляторных требований, снижению операционных затрат и повышению доверия как со стороны внутренних пользователей, так и со стороны клиентов. Низкокачественные данные дают противоположный результат: упущенные возможности, ошибочная стратегия и напрасные усилия. Именно поэтому опросы неизменно показывают, что специалисты по данным тратят большую часть времени на их подготовку, а большинство генеральных директоров сообщают об озабоченности качеством данных, на которые они опираются.
В чём разница между точностью и валидностью данных?
Точность касается правильности: соответствует ли значение реальному факту, который оно представляет. Корректность касается соответствия: следует ли значение заданным правилам, форматам и диапазонам. Значение может быть корректным, но неточным, например, правильно отформатированный номер телефона, принадлежащий не тому человеку, или точным по смыслу, но некорректным из-за хранения в неправильном формате. Высокое качество данных требует и того, и другого.
Как веб-скрапинг влияет на качество данных?
Веб-скрапинг нередко является этапом сбора, питающим анализ, поэтому его надёжность устанавливает верхнюю границу качества. Заблокированные запросы, неполные страницы и несогласованная структура ухудшают точность, полноту и согласованность ещё до того, как запускается какая-либо проверка. Надёжный скрапинг, справляющийся с рендерингом, ротацией и блокировками, возвращает полные и согласованные страницы, что означает более чистые входные данные и меньше проблем с качеством для устранения в дальнейшем.
Обходите любой сайт в масштабе, без борьбы с инфраструктурой.
Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.
