Вы вводите несколько слов в поле поиска, нажимаете Enter, и за долю секунды появляется упорядоченный список страниц. За этим простым моментом стоят три крупнейших инженерных системы в интернете: Google, Bing и Yahoo. Они непрерывно обходят интернет за вас, организуя миллиарды страниц в нечто, что можно запрашивать на обычном языке.

Эта статья объясняет, что такое поисковая система на самом деле и как она работает: от сканирования открытого интернета до ранжирования и выдачи результатов. Рассматриваются отличия Google, Bing и Yahoo (и почему Yahoo работает на базе Bing), из чего состоит страница результатов и почему всё это важно для тех, кто собирает публичные поисковые данные для исследований, SEO или анализа рынка.

Что такое поисковая система?

Поисковая система это программное обеспечение, которое обнаруживает страницы в интернете, хранит структурированную копию найденного и возвращает наиболее релевантные совпадения, когда пользователь вводит запрос. Единого реестра всех существующих страниц не существует, поэтому поисковой системе приходится самостоятельно их находить, разбираться в них и поддерживать эту картину актуальной по мере изменения интернета.

Три компании доминируют на рынке поиска общего назначения: Google, Bing от Microsoft и Yahoo. Все они решают одну и ту же базовую задачу, но с разной инфраструктурой, разными приоритетами ранжирования и разными долями рынка. Их объединяет общий конвейер, и понимание этого конвейера является ключом к пониманию всей темы.

Четыре этапа, единые для каждой системы. Поисковая система сканирует интернет для обнаружения страниц, индексирует найденное в доступное для поиска хранилище, ранжирует кандидатов по запросу, затем выдаёт упорядоченные результаты в виде SERP. Google, Bing и Yahoo следуют этой схеме; они различаются в деталях каждого этапа.

Как работает поисковая система

Каждая универсальная поисковая система выполняет одни и те же четыре этапа по порядку: сканирование, индексирование, ранжирование и выдача. Google описывает собственный процесс как сканирование, индексирование и выдачу (с ранжированием, включённым в выдачу), но суть везде одинакова. Разбор каждого этапа является наиболее ясным способом понять, что эти системы действительно делают.

1. Сканирование

Сканирование это этап обнаружения. Автоматизированные программы, называемые краулерами или пауками, загружают страницы, читают их содержимое и переходят по находящимся в них ссылкам, чтобы найти новые страницы. Поскольку центрального реестра интернета не существует, поисковая система находится в непрерывном цикле обнаружения новых и обновлённых страниц. Она узнаёт о них несколькими способами: повторно посещает уже известные страницы, переходит по ссылкам с известной страницы на новую и читает карты сайта, которые владельцы сайтов предоставляют для указания свежих или изменённых URL. Управляемые хостинги вроде Wix или Blogger нередко уведомляют поисковую систему автоматически при публикации нового контента.

Когда краулер достигает страницы, он загружает HTML и всё чаще отрисовывает страницу так, как это делает браузер, чтобы увидеть контент, добавляемый JavaScript после загрузки. Он анализирует текст, изображения и общий визуальный макет, чтобы понять назначение страницы. Чем лучше краулер понимает страницу, тем точнее поисковая система сможет впоследствии сопоставить её с нужными запросами. Если ваши цели активно используют клиентскую отрисовку, наше руководство по сканированию JavaScript-сайтов разбирает механику детально.

2. Индексирование

После получения страницы поисковая система пытается понять, о чём она. Этот процесс называется индексированием. Система анализирует текст, каталогизирует изображения и видео, встроенные на странице, отмечает структурные сигналы вроде заголовков и метаданных и сохраняет всё это в гигантской структуре данных, называемой индексом. Индекс по сути является картой от слов и понятий к страницам, которые их содержат, организованной так, чтобы поисковая система могла находить совпадения за миллисекунды, а не повторно сканировать интернет при каждом запросе.

Не каждая сканированная страница попадает в индекс. Страницы-дубликаты, заблокированные от индексирования или признанные малоценными, могут быть отброшены. То, что остаётся, является доступным для поиска корпусом, против которого выполняются все будущие запросы.

3. Ранжирование

Когда вы выполняете запрос, индекс обычно содержит тысячи или миллионы страниц-кандидатов, соответствующих вашим словам. Ранжирование это этап, определяющий, какие из них идут первыми. Система оценивает каждого кандидата по множеству сигналов: насколько страница соответствует смыслу запроса, качество и актуальность контента, удобство страницы и авторитетность источника. Важен и контекст о вас: местоположение, язык и устройство, поэтому поиск по запросу «велосипедные мастерские» даёт разные результаты в Москве и Токио.

Стоит прямо сказать: крупные поисковые системы не позволяют никому платить за более высокое место в органических результатах. Платное размещение существует, но оно отображается как чётко помеченная реклама, отдельно от алгоритмически ранжированных листингов.

4. Выдача результатов (SERP)

Финальный этап собирает ранжированных кандидатов в страницу, которую вы реально видите: страницу результатов поисковой системы, или SERP. Выдача происходит быстро, потому что основная работа уже была выполнена при индексировании; поисковая система в основном ищет предвычисленные данные и упорядочивает их для вашего запроса и контекста. Современная SERP это значительно больше, чем десять синих ссылок, и следующий раздел разбирает её содержание.

Что на самом деле содержит SERP

Страница результатов имеет структурированный макет с несколькими различными компонентами, и набор меняется в зависимости от запроса. Основные элементы, с которыми вы столкнётесь:

  • Органические результаты. Алгоритмически ранжированные листинги, каждый с заголовком, URL и описательным сниппетом. Это ядро SERP, то, что большинство людей понимают под «результатами поиска».
  • Платная реклама. Спонсированные листинги, отображаемые выше или ниже органического блока, помеченные как реклама. Они куплены, а не ранжированы, и часто нацелены на коммерческие запросы с высоким намерением.
  • Избранные сниппеты и блоки ответов. Прямой ответ, взятый со страницы и показанный в верхней части, чтобы пользователь мог прочитать его без перехода по ссылке.
  • Люди также спрашивают. Раскрываемый список связанных вопросов, показывающий, как поисковая система группирует намерения вокруг темы. Сбор этих данных является отдельной дисциплиной, рассмотренной в статье скрапинг блока «Люди также спрашивают».
  • Панель знаний. Сводный блок о сущностях: компаниях, людях или местах, извлечённый из структурированных источников и отображаемый сбоку или вверху.
  • Локальный блок. Карта и краткий список ближайших предприятий для запросов с локальным намерением.

Для более подробного обзора этих элементов и методов их масштабного сбора смотрите наше расширенное руководство как скрапить страницы поиска Google.

Чем Google, Bing и Yahoo отличаются друг от друга

Три поисковые системы выполняют один и тот же конвейер, но они не взаимозаменяемы. Вот как они сравниваются по наиболее значимым параметрам.

Engine Operator Index source Known for
Google Google Собственный краулер и индекс Наибольшая доля рынка, самый глубокий индекс, самое быстрое развитие функций
Bing Microsoft Собственный краулер и индекс Обеспечивает поиск Microsoft и многих партнёров; сильные продукты для изображений, видео и карт
Yahoo Yahoo Поисковый индекс Bing Портальный бренд (новости, финансы, спорт, шопинг) поверх веб-поиска на базе Bing

Google

Google является наиболее используемой поисковой системой в мире и имеет собственный краулер и индекс. Как правило, она обеспечивает наиболее широкое покрытие интернета и быстрее всех выпускает новые функции SERP, поэтому большинство работ по SEO и поисковым данным ориентировано именно на неё. Если ваша цель понять, как ведёт себя более широкий рынок, данные Google обычно являются базовым показателем. Наш материал о том, как Google сканирует сайты, подробнее разбирает его краулер.

Bing

Bing это поисковая система, созданная и эксплуатируемая Microsoft. Она выросла из более ранних продуктов Microsoft (MSN Search, Windows Live Search и Live Search) и сегодня предлагает поиск по интернету, изображениям, видео и картам. Bing выполняет собственный независимый обход и индексирование, что делает его подлинно отдельным источником данных от Google, а не его зеркалом. Именно эта независимость и является причиной, почему Bing важен для тех, кто хочет получить второй взгляд на поисковый ландшафт.

Yahoo

Yahoo существует в интернете с середины 1990-х и остаётся крупным порталом для новостей, финансов, спорта и шопинга. Важный технический факт состоит в том, что Yahoo больше не имеет собственного индекса веб-поиска. Его веб-результаты работают на базе Bing, поэтому запрос в Yahoo и тот же запрос в Bing обращаются к одному и тому же базовому индексу, хотя Yahoo оборачивает их в собственный интерфейс и портальный контент. Для сбора данных это означает, что результаты Yahoo и Bing в значительной мере пересекаются, и обычно предпочтительнее обращаться к первоисточнику, а не собирать с обоих.

Crawlbase Crawling API

Сбор поисковых данных кажется простым, пока поисковая система не меняет вёрстку, не подаёт CAPTCHA или не блокирует ваш IP после нескольких сотен запросов. Crawling API решает трудную часть в рамках одного управляемого запроса: отрисовывает JavaScript, ротирует реальные пользовательские IP, предъявляет согласованные заголовки браузера и поглощает CAPTCHA, так что вы указываете URL Google, Bing или Yahoo и получаете в ответ чистый HTML вместо страниц блокировки. Получите до 20 000 бесплатных запросов без кредитной карты.

Почему это важно для сбора поисковых данных

Поисковые системы не просто инструменты для ввода запросов; они являются одними из богатейших публичных наборов данных в интернете. Ранжированные результаты, реклама, связанные вопросы и локальные листинги по заданному запросу представляют собой моментальный снимок спроса, конкуренции и качества контента по данной теме. Именно поэтому многие команды собирают поисковые данные программным способом.

Практические сценарии использования конкретны:

  • SEO-исследования. Отслеживайте, какие страницы ранжируются по каким ключевым словам, наблюдайте за изменением позиций со временем и изучайте функции (сниппеты, «Люди также спрашивают», локальные блоки), появляющиеся по вашим целевым запросам. Наше руководство по использованию данных для улучшения SEO развивает эту тему.
  • Конкурентный и рыночный анализ. Смотрите, кто появляется по коммерческим запросам, какие рекламные тексты используют конкуренты и как меняется ландшафт по регионам или устройствам.
  • Сравнение цен и товаров. Сравнительные сайты извлекают листинги товаров и цены прямо из результатов поиска и шопинга, чтобы поддерживать актуальность собственных данных.
  • Исследования и мониторинг трендов. Аналитики и исследователи выборочно собирают результаты в масштабе, чтобы измерить видимость, настроения и то, как темы всплывают в разных поисковых системах.

Поскольку Bing и Yahoo разделяют один индекс, сбор данных с обеих поисковых систем по одному запросу обычно избыточен; выбирайте источник. Google, напротив, является подлинно независимым набором данных, поэтому большинство серьёзных работ с поисковыми данными охватывает Google плюс Bing для широты охвата. Помимо трёх крупнейших, для отдельных рынков важны региональные поисковые системы, поэтому существуют руководства по конкретным целям вроде результатов поиска Baidu.

Ответственный скрапинг

Сбор поисковых данных является распространённой практикой, но должен выполняться осторожно. Условия использования каждой поисковой системы, как правило, ограничивают прямой скрапинг SERP, и там, где существует официальный поисковый API, это более предпочтительный путь. Соблюдайте директивы robots.txt, отдавайте предпочтение публичным результатам перед всем, что скрыто за авторизацией, и никогда не собирайте персональные данные без законного основания. Поддерживайте разумный темп запросов, чтобы не ухудшать качество обслуживания реальных пользователей, и кешируйте результаты, чтобы не повторно загружать одни и те же страницы. Поисковые системы располагают зрелой защитой от ботов именно потому, что их результаты являются постоянной мишенью, поэтому вежливый, ориентированный только на публичные данные подход является одновременно этичным выбором и тем, который с наименьшей вероятностью приведёт к блокировке. Наше руководство по тому, как поисковые системы обнаруживают скраперов, объясняет, что именно измеряет эта защита.

Итоги

Ключевые выводы

  • Поисковая система это конвейер от обнаружения до ответа. Она находит страницы, хранит их структурированную копию, ранжирует по запросу и выдаёт результат, всё это за долю секунды.
  • Четыре этапа везде одинаковы. Сканирование обнаруживает страницы, индексирование делает их доступными для поиска, ранжирование упорядочивает кандидатов, выдача собирает SERP, который вы видите.
  • Yahoo работает на базе Bing. Google и Bing имеют независимые краулеры и индексы; Yahoo оборачивает индекс Bing в собственный портал, поэтому веб-результаты Yahoo и Bing в значительной мере совпадают.
  • SERP это больше, чем десять ссылок. Органические результаты, реклама, избранные сниппеты, «Люди также спрашивают», панели знаний и локальные блоки несут разные данные, которые стоит захватывать.
  • Поисковые данные это публичный набор данных. SEO, конкурентный анализ и сравнение цен зависят от их ответственного сбора: публичные данные, разумный темп, соблюдение условий использования и robots.txt.

Часто задаваемые вопросы

Что такое поисковая система простыми словами?

Поисковая система это программное обеспечение, которое читает интернет, хранит организованную копию найденного и возвращает наиболее релевантные страницы, когда вы выполняете запрос. Google, Bing и Yahoo являются основными примерами общего назначения. Все они сканируют страницы, индексируют их, ранжируют по вашему запросу и выдают упорядоченный список результатов за долю секунды.

Чем Google, Bing и Yahoo отличаются друг от друга?

Google и Bing имеют собственные краулеры и индексы, поэтому являются независимыми источниками данных с разным охватом и ранжированием. Google располагает наибольшей долей рынка и наиболее глубоким индексом. Yahoo больше не имеет собственного индекса веб-поиска; его веб-результаты работают на базе Bing, поэтому Yahoo и Bing возвращают во многом совпадающие результаты, обёрнутые в разные интерфейсы.

Yahoo и Bing это одно и то же?

Базовые веб-результаты по сути одинаковы, поскольку веб-поиск Yahoo работает на индексе Bing. Yahoo по-прежнему добавляет собственный портальный контент (новости, финансы, спорт, шопинг) и представляет результаты в своём интерфейсе, но ранжированные веб-листинги исходят от Bing. Для сбора данных это означает, что запрашивать обе поисковые системы по одному и тому же запросу обычно избыточно.

Какие четыре этапа работы поисковой системы?

Сканирование, индексирование, ранжирование и выдача. Сканирование обнаруживает страницы, следуя по ссылкам и читая карты сайта. Индексирование анализирует каждую страницу и сохраняет её в структуру, доступную для поиска. Ранжирование оценивает совпадающие страницы по вашему запросу и контексту. Выдача собирает упорядоченные результаты в SERP, который вы видите. Google группирует ранжирование внутри выдачи, но суть работы одна и та же.

Что содержит SERP?

Страница результатов поисковой системы обычно смешивает органические (алгоритмически ранжированные) листинги с платной рекламой, а в зависимости от запроса может также включать избранные сниппеты, вопросы из блока «Люди также спрашивают», панель знаний и локальный блок с картой. Каждый компонент несёт разные данные, поэтому всем, кто собирает результаты поиска, необходимо знать полную анатомию страницы.

Можно ли заплатить поисковой системе за более высокую позицию?

Не в органических результатах. Крупные поисковые системы ранжируют органические листинги алгоритмически и не принимают оплату за продвижение страницы вверх. Платное размещение существует, но оно отображается как чётко помеченная реклама, отдельная от ранжированных листингов, так что эти два типа никогда не смешиваются.

Начать создавать

Обходите любой сайт в масштабе, без борьбы с инфраструктурой.

Crawlbase берёт на себя прокси, отпечатки и CAPTCHA, чтобы ваша команда выпускала конвейеры данных вместо поддержки обвязки краулинга. 1 000 запросов бесплатно, без карты.

Самообслуживание · Звонок отдела продаж не требуется · Доступны корпоративные объёмы краулинга