Хедж-фонды конкурируют на информации, а квартальные отчёты или заголовки пресс-релизов поступают на все рабочие столы одновременно. К тому моменту, когда цифры становятся официальными, сделка уже переполнена. Альтернативные данные, ответ на это: нетрадиционные, преимущественно публичные сигналы, намекающие на состояние компании или рынка до официальных данных. Веб-парсинг, это то, как большая часть этих данных собирается: цены, объявления, отзывы и паттерны трафика извлекаются из открытого интернета в темпе и масштабе, недостижимом вручную ни одним аналитиком.

В этой статье объясняется, как фонды реально используют альтернативные данные, полученные парсингом. Мы рассмотрим публичные сигналы, на которые стоит обращать внимание, как сырой сигнал превращается в исследовательский или торговый ввод через воспроизводимый конвейер, и операционные трудности работы в масштабе. Мы также чётко обозначим черту, которую ответственные фирмы не пересекают, поскольку ценность этих данных полностью зависит от того, собираются ли они правильным образом.

Что такое альтернативные данные в трейдинге?

Альтернативные данные, это любая информация, используемая для принятия инвестиционных решений, которая не поступает из традиционных источников: отчётности компаний, звонков о прибылях, аналитических отчётов и биржевых ценовых потоков. Вместо этого они поступают из цифрового следа обычной деловой активности, публичного следа, который компания и её клиенты оставляют в интернете. Страницы продуктов розничного продавца, карьерная доска программной компании, поток отзывов приложения, расписание грузоперевозок на логистическом портале: ничто из этого не создавалось для отчёта о финансовых показателях, но в совокупности это говорит о них очень многое.

Привлекательность, в своевременности и детализации. Отчётность говорит о том, что произошло в прошлом квартале; парсинговые цены и уровни запасов рассказывают, что происходит на этой неделе. При правильном использовании альтернативные данные позволяют фонду сформировать взгляд раньше консенсуса, более уверенно войти в позицию или вовремя заметить ухудшение истории. При небрежном использовании они производят шумные, смещённые или устаревшие вводные данные, уводящие модель не туда, поэтому шаги сбора и очистки важны не меньше идеи.

Публичные сигналы, которые парсят хедж-фонды

Ни один источник данных сам по себе не даёт преимущества. Работа заключается в объединении нескольких слабых, независимых публичных сигналов в более сильный взгляд, чем любой из них по отдельности. Вот категории, встречающиеся чаще всего, все из данных, доступных любому посетителю открытого интернета.

Цены и уровни запасов в e-commerce

Страницы продуктов на крупных розничных и маркетплейсных сайтах отображают цены, акции и доступность в режиме, близком к реальному времени. Отслеживание цен каталога компании, частоты отсутствия товаров на складе и агрессивности скидок конкурентов даёт понимание спроса и маржи задолго до подтверждения отчётом о выручке. Устойчивая серия распроданных товаров может сигнализировать о хороших продажах; волна уценок, об обратном. В совокупности по тысячам SKU это становится полезным прокси для квартала розничного продавца. Тот же подход лежит в основе более широкой работы по ценовой разведке, где парсинговые цены определяют как конкурентные, так и инвестиционные решения.

Вакансии и тренды найма

Страницы карьеры и биржи труда, одни из самых чистых доступных сигналов роста. Компания, открывающая инженерные и торговые вакансии в новом регионе, инвестирует туда; компания, тихо убирающая объявления или замораживающая функцию, уходит. Подсчёт открытых вакансий со временем, по команде и по местоположению, превращает разрозненный набор объявлений в траекторию найма. Фонды используют это для оценки экспансии, обнаружения перехода в новую продуктовую линейку или улавливания ранних признаков замедления до того, как изменения в численности персонала отразятся в финансовой отчётности.

Отзывы и рейтинги приложений

Для потребительского программного обеспечения и компаний с мобильным ядром публичный поток отзывов, это непрерывный опрос клиентов. Объём новых отзывов отражает внедрение, средний рейтинг, удовлетворённость, а внезапный сдвиг в любом из них отражает удачно или неудачно принятое изменение продукта. Массовое чтение текстов отзывов также выявляет конкретные жалобы или функции, определяющие настроения, что скрывает звёздный рейтинг в одиночку. Для фонда, держащего позицию в компании с основой в приложении, изменение тренда рейтинга, ранний публичный взгляд на удержание.

Данные о доставке и логистике

Публичные записи о доставке, активность портов и расписания перевозчиков открывают физическую сторону торговли. Растущие объёмы поставок в регион могут подтвердить историю о спросе; задержки и перегруженность ключевого порта могут сигнализировать о проблемах в цепочке поставок, которые в конечном счёте ударят по затратам производителя или полкам розничного продавца. Поскольку эти сигналы стоят выше по потоку от выручки, они нередко движутся до того, как затронутые компании что-либо признают, что делает их ценными для предвидения сбоев, а не реагирования на них.

Прокси веб-трафика

Привлечение внимания к веб-ресурсам компании, грубый прокси интереса и в конечном счёте спроса. Публичные индикаторы, такие как интерес к поиску, рейтинг в магазине приложений и другие открыто доступные показатели популярности, можно отслеживать во времени, чтобы видеть, набирает или теряет импульс бренд. Ни один прокси не точен, но устойчивый рост по нескольким из них, подтверждающий сигнал, а устойчивое снижение, предупреждение. Фонды воспринимают их как направленные вводные данные, а не точные счётчики трафика.

Настроения из новостей и публичного обсуждения

Финансовые новости, блоги, пресс-релизы и публичные обсуждения несут нарратив вокруг акции, а нарратив движет ценами. Парсинг этих источников и обработка естественного языка по ним количественно определяют тон: насколько позитивны или негативны материалы, как быстро распространяется история и когда настроения меняются. Цель не в чтении отдельных постов, а в измерении совокупного настроения и его скорости изменения, что может опережать движение цены вокруг отчётов, запусков продуктов или разворачивающихся событий. Настроение само по себе шумное, поэтому оно обычно является одним из нескольких вводных данных, а не самостоятельным триггером.

Публичные сигналы становятся преимуществом только после обработки. Многие слабые источники поступают на шаг сбора и очистки, превращающий разрозненные страницы в структурированные, сопоставимые данные, которые уровень единого сигнала оценивает и передаёт на исследовательское или торговое решение. Преимущество живёт в конвейере, а не в каком-либо одном сыром источнике.

Превращение сырого сигнала в торговый ввод

Распарсенная страница, не торговый сигнал. Между ними стоит конвейер, берущий беспорядочные, непоследовательные веб-данные и превращающий их в число, с которым может работать модель или аналитик. Описанные ниже этапы выполняются по порядку, и большая часть реальной работы приходится на непривлекательные средние. Пропуск их, вот как фонды оказываются в ситуации, когда торгуют на шуме.

Сбор

Сбор, это сам парсинг: загрузка целевых страниц по расписанию, рендеринг любого JavaScript, скрывающего данные, и преодоление блокировок, которые ставят высокоценные сайты. Ключевое требование, полнота охвата и последовательность. Ценовой сигнал, построенный на выборке, которая незаметно сокращается, когда сайт начинает вас блокировать, дрейфует, и никто этого не замечает. Цель, полный, надёжный сбор тех же источников с той же периодичностью при каждом запуске, чтобы получившийся временной ряд был сопоставим по периодам. Запуск этого в масштабе, нужном фонду, рассматривается в статье веб-парсинг в больших масштабах, где пропускная способность и устойчивость важнее любого отдельного запроса.

Очистка

Сырые извлечения грязные. Имена полей различаются между сайтами, цены приходят в разных валютах и форматах, дубликаты проникают, и страницы иногда возвращают частичный или некорректный контент. Очистка удаляет дубликаты, исправляет или отбрасывает плохие записи, стандартизирует форматы и обрабатывает пропущенные значения, которые иначе перекосили бы среднее. Здесь же вы улавливаете тихие сбои: изменение макета, незаметно сломавшее парсер, или блокировку, вернувшую страницу ошибки вместо данных. Наш гайд по структурированию и очистке веб-данных охватывает методы, делающие данные достаточно надёжными для моделирования.

Структурирование

Очищенные данные всё ещё должны быть преобразованы в согласованную схему до того, как их можно будет сравнивать или объединять. Структурирование отображает каждый источник в один и тот же набор сущностей и полей, продукт с ценой и временной меткой, вакансия с командой и местоположением, чтобы данные одного сайта выровнялись с данными другого и с историей. Чётко определённая целевая форма, то, что позволяет объединить ценовой поток с потоком найма и потоком настроений и обращаться с ними как с одним набором данных, а не кучей несовместимых экспортов.

Бэктестирование

Прежде чем сигнал торгует реальными деньгами, он тестируется на истории. Бэктестирование спрашивает, предсказывал ли бы сигнал результаты, на которые он претендует: действительно ли растущие показатели распроданности предшествовали более сильным кварталам, действительно ли смены настроений опережали движение цен, и насколько? Здесь отвергается большинство сигналов-кандидатов, потому что масса правдоподобно звучащих данных оказывается без какой-либо предсказательной силы при честной проверке. Сигнал, выдержавший строгий, свободный от смещений бэктест, занимает место в исследовательском процессе; не выдержавший откладывается на полку.

Мониторинг

Сигнал, работающий сегодня, может деградировать завтра. Сайты перестраиваются, блокировки ужесточаются, источник данных меняет условия, или некогда предсказательная взаимосвязь просто перестаёт выполняться. Мониторинг следит как за данными, так и за сигналом: он отслеживает охват и свежесть, чтобы вы знали, что поток ещё полный, и отслеживает производительность сигнала в реальном времени, чтобы вы знали, что он по-прежнему работает. При ухудшении любого из них сигнал приостанавливается или переобучается, а не используется вслепую. Это непрерывная проверка, отделяющая поддерживаемую программу альтернативных данных от разового бэктеста, который тихо деградирует.

Crawlbase Crawling API

Сбор, то место, где большинство программ альтернативных данных застревает: высокоценные розничные, карьерные и ревью-сайты рендерятся с JavaScript и активно противодействуют парсерам, а поток, который незаметно теряет охват, отравляет каждый сигнал нижестоящего. Crawlbase Crawling API обрабатывает рендеринг, ротацию прокси и обработку CAPTCHA, чтобы те же источники возвращались полными при каждом запуске, а асинхронный Crawler передаёт результаты на обратный вызов для больших, плановых сборов. Вы платите только за успешные запросы, поэтому заблокированные запросы вам ничего не стоят.

Операционные трудности при работе в масштабе

Идея, лёгкая часть. Поддерживать программу сбора достаточно надёжной для торговли, трудная часть, и три проблемы доминируют.

Масштаб

Серьёзный поток альтернативных данных означает сбор по многим источникам, нередко тысячи страниц каждый, по строгому и повторяющемуся расписанию. Это инфраструктурная проблема: параллельная загрузка, постановка в очередь, повторы и хранение должны выдерживать запуск за запуском без ручного надзора. По мере роста охвата растёт и стоимость поддержки хрупких, специфичных для сайта парсеров, поэтому фонды полагаются на управляемый сбор, а не разрабатывают краулер вручную для каждой цели.

Свежесть

Ценность большинства этих сигналов в том, чтобы быть первыми, поэтому поток с задержкой, это поток, утративший преимущество. Свежесть означает сбор с периодичностью, соответствующей скорости изменения базового сигнала, ежедневно или чаще для цен и настроений, и получение чистых данных через конвейер достаточно быстро, чтобы решение могло действовать на них, пока они ещё имеют значение. Устаревшие данные не просто менее полезны; они могут активно вводить в заблуждение, если модель предполагает, что они актуальны.

Блокировки и изменения сайтов

Сайты, стоящие того, чтобы парсить, именно те, которые инвестируют в блокировку парсеров. CAPTCHA, ограничения частоты и обнаружение ботов угрожают охвату, а любая частичная блокировка, оставшаяся незамеченной, искажает временной ряд. Кроме того, сайты перестраиваются без предупреждения, ломая парсеры и незаметно теряя поля. Борьба с этим означает ротацию прокси, рендеринг как настоящий браузер и мониторинг как явных блокировок, так и тихих структурных изменений, чтобы пробел в данных был обнаружен и исправлен, а не передан в модель как реальный.

Ответственный и законопослушный парсинг

Всё вышесказанное зависит от правильного способа сбора данных, и это не примечание. Ответственная работа с альтернативными данными строго придерживается публичных данных: информации, которую любой посетитель может увидеть без входа в систему, обхода средств контроля доступа или уклонения от заявленных желаний сайта. Она уважает условия обслуживания и robots.txt каждого сайта и парсит в разумном темпе, не обременяющем источник. Небольшой иллюстративный сбор публичных объявлений, выполненный вежливо, выглядит так:

python
import time, requests

listings = []
for url in public_product_urls:
    page = requests.get(url)        # public page only
    listings.append(parse(page))
    time.sleep(2)                  # polite, rate-limited

Выше всего этого стоят два жёстких ограничения. Фирмы не торгуют на существенной непубличной информации (MNPI): веб-парсинг, инструмент для сбора публичных данных, никогда не являющийся лазейкой к частной или инсайдерской информации, и использование его для получения MNPI незаконно независимо от способа получения данных. И ответственные программы не собирают персональные данные: цель, агрегированный сигнал на уровне компании, а не информация об идентифицируемых физических лицах, что позволяет работе оставаться в стороне от таких режимов конфиденциальности, как GDPR и CCPA. Публичные, агрегированные, вежливые и не персональные данные, вот и вся игра; данные, собранные любым другим образом, являются обязательством, а не преимуществом.

Итоги

Ключевые выводы

  • Альтернативные данные покупают своевременность. Публичные веб-сигналы намекают на показатели компании и рынка до подтверждения официальными отчётами, в этом и состоит преимущество.
  • Сигналы разнообразны и публичны. Цены и запасы e-commerce, вакансии, отзывы приложений, данные о доставке, прокси веб-трафика и настроения, наиболее распространённые категории, лучше всего работающие в комбинации.
  • Конвейер, это продукт. Сбор, очистка, структурирование, бэктестирование и мониторинг превращают сырой парсинг в надёжный торговый ввод; именно на средних этапах отвергается большинство сигналов.
  • Масштаб, свежесть и блокировки, операционные риски. Поток, незаметно теряющий охват или отстающий от отслеживаемого сигнала, хуже, чем никакого потока.
  • Ответственность, не опция. Придерживайтесь публичных данных, уважайте ToS и robots.txt, никогда не торгуйте на MNPI и не собирайте персональные данные.

Часто задаваемые вопросы

Что такое альтернативные данные для хедж-фондов?

Альтернативные данные, это информация для инвестиционных решений, не поступающая из традиционных источников, таких как отчётность, звонки о прибылях и биржевые ценовые потоки. Они черпаются из публичного цифрового следа деловой активности: цены продуктов, вакансии, отзывы приложений, записи о доставке, индикаторы веб-трафика и публичные настроения. В совокупности эти сигналы могут намекать на показатели компании раньше официальных отчётов, в этом и состоит преимущество, которое ищут фонды.

Законен ли веб-парсинг для торговли и инвестиционных исследований?

Сбор общедоступных данных в целом допустим при ответственном подходе: соблюдении условий обслуживания и robots.txt каждого сайта, парсинге в разумном темпе и избегании данных за логинами или средствами контроля доступа. Серьёзные юридические рамки отдельны от самого парсинга. Торговля на существенной непубличной информации незаконна независимо от способа её получения, а сбор персональных данных активирует такие режимы конфиденциальности, как GDPR и CCPA. Ответственные программы остаются публичными, агрегированными и не персональными.

Какие публичные сигналы чаще всего парсят фонды?

Распространённые категории: цены e-commerce и доступность запасов, вакансии и тренды найма, отзывы и рейтинги приложений, данные о доставке и логистике, прокси веб-трафика, такие как интерес к поиску и рейтинг в магазине приложений, а также настроения из новостей и публичных обсуждений. Ни одна не является решающей сама по себе; ценность в объединении нескольких слабых, независимых сигналов в более сильный взгляд, чем любой из них по отдельности.

Как сырой парсинг становится торговым сигналом?

Он проходит через конвейер: надёжный сбор страниц по расписанию, очистка грязного извлечения удалением дубликатов и стандартизацией форматов, структурирование всего в согласованную схему, бэктестирование сигнала на истории для подтверждения реальной предсказательной силы, затем мониторинг как потока, так и сигнала, чтобы деградация была поймана. Большинство сигналов-кандидатов отвергается на этапе бэктестирования, потому что правдоподобно звучащие данные часто не имеют реальной предсказательной силы.

Каковы самые сложные части работы по сбору альтернативных данных?

Масштаб, свежесть и блокировки. Сбор тысяч страниц по многим источникам по повторяющемуся расписанию, инфраструктурная задача; поддержание данных достаточно свежими для действия, пока сигнал ещё важен, задача тайминга; а преодоление CAPTCHA, ограничений частоты и частых перестроек сайтов без незаметной потери охвата, задача надёжности. Поток, тихо деградирующий, отравляет каждый построенный на нём сигнал.

Где можно узнать о провайдерах данных и ценовых сигналах?

Для обзора поставщиков и потоков в этой сфере см. наш обзор лучших провайдеров финансовых данных. Для механики превращения парсинговых цен в используемый сигнал, лежащей в основе большей части категории e-commerce выше, см. наш гайд по парсингу для ценовой разведки.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга