Написать нам в Telegram

Поисковая машина: как устроен поиск изнутри

SEO
14 августа 2026 г.
Фото Александр Ш.
Александр Ш.SEO-специалист

Поисковая машина (поисковый движок) — комплекс программ, который обходит сайты, сохраняет их содержимое и по запросу пользователя подбирает наиболее подходящие страницы. Это техническое ядро поисковой системы.

Разница в словах небольшая, но её стоит зафиксировать: поисковая система — это сервис целиком, с интерфейсом, картинками, картами и рекламой; поисковая машина — та часть, которая ищет. Ниже — как она устроена и почему это знание меняет практику работы с сайтом.

Три этапа работы

  1. Обход (краулинг). Программа-робот переходит по ссылкам и скачивает страницы. Обход не бесконечен: на каждый сайт выделяется ограниченный ресурс.
  2. Индексация. Скачанное разбирается: выделяется текст, заголовки, ссылки, разметка. Страница либо попадает в базу, либо отбраковывается как малоценная или дублирующая.
  3. Ранжирование. В момент запроса из базы отбираются подходящие страницы и выстраиваются в порядке, который система считает полезным.

Ключевое следствие: эти этапы разделены во времени. Робот может побывать на странице сегодня, проиндексировать через неделю, а показать по запросу — ещё позже. Поэтому «робот заходил» и «страница в поиске» — разные утверждения: индексация сайта.

Что такое обратный индекс

Главная инженерная идея поиска. Перебирать миллиарды страниц в момент запроса невозможно — ответ занял бы часы. Поэтому база строится наоборот.

Обычный индекс — это «страница → её слова». Обратный индекс — «слово → список страниц, где оно встречается». Когда человек вводит запрос, система не читает страницы, а достаёт готовые списки по каждому слову и пересекает их. Отсюда мгновенный ответ.

Из этой конструкции следуют вещи, которые обычно объясняют иначе:

  • Текст должен быть текстом. Слова, набранные картинкой, в обратный индекс не попадают — их для поиска не существует.
  • Словоформы приводятся к начальной форме. «Дверей», «двери», «дверь» сводятся к одной записи — поэтому вписывать все склонения бессмысленно.
  • Служебные слова обычно отбрасываются при обработке запроса.
  • Позиция слова на странице учитывается — заголовок и первый абзац весят больше, чем подвал.

Как отбирается ответ

После пересечения списков остаются тысячи страниц-кандидатов, и их надо упорядочить. Здесь работают сотни факторов, которые группируются в несколько классов.

Класс факторовЧто оценивается
ТекстовыеНасколько страница отвечает на запрос — релевантность
СсылочныеКто и как на неё ссылается
ПоведенческиеЧто делают люди, попав на страницу
ТехническиеСкорость, доступность, работа на телефоне
КоммерческиеЦены, контакты, реквизиты, отзывы — важны для Яндекса
ХостовыеВозраст, история и общее качество сайта

Современные системы не складывают факторы вручную заданными весами: формула строится машинным обучением на оценках асессоров — людей, которые размечают, насколько выдача отвечает запросу. Поэтому «точную формулу» не знает никто, включая сотрудников поисковых систем.

Что изменилось с приходом генеративных ответов

Поверх трёх классических этапов появился четвёртый: сборка ответа. Система берёт несколько источников из верха выдачи и формирует связный текст, а ссылки на источники ставит рядом.

Для владельца сайта меняется цель: раньше надо было попасть в список ссылок, теперь — в число источников, из которых собирается ответ. Как это устроено — нейроответы Яндекса и Google.

Что из этого следует для сайта

  1. Не тратьте бюджет обхода на мусор. Служебные адреса, сортировки, бесконечные комбинации фильтров съедают визиты робота вместо новых страниц.
  2. Проверяйте, что страница именно в индексе, а не просто доступна.
  3. Держите текст текстом и не прячьте его за скриптами, которые робот может не выполнить.
  4. Следите за ответами сервера. Ошибки прерывают обход — ошибки 5xx.
  5. Смотрите отчёты Вебмастера и Search Console — это единственный способ увидеть сайт глазами машины, а не браузера.

Коротко

  • Поисковая машина — техническое ядро поисковой системы: обход, индексация, ранжирование.
  • Этапы разделены во времени: обход не равен попаданию в поиск.
  • Основа скорости — обратный индекс: «слово → страницы», а не наоборот.
  • Текст в картинке в индекс не попадает; словоформы приводятся к начальной форме.
  • Формула ранжирования строится машинным обучением, точных весов не знает никто.
  • С генеративными ответами добавился четвёртый этап — сборка ответа из источников.

Приводим сайт в состояние, понятное поисковым машинам, — поисковое продвижение сайтов.

Частые вопросы

Комплекс программ, который обходит сайты, сохраняет их содержимое в базу и по запросу подбирает подходящие страницы. Это техническая часть поисковой системы, отвечающая непосредственно за поиск.

Поисковая система — сервис целиком: интерфейс, картинки, карты, реклама, ответы. Поисковая машина — та её часть, которая обходит сайты, строит индекс и ранжирует результаты.

Система не перебирает страницы в момент запроса. Она заранее строит обратный индекс — список страниц для каждого слова — и при запросе пересекает эти списки, а затем ранжирует то, что осталось.

Чаще всего страница либо не обойдена роботом, либо обойдена, но не проиндексирована — из-за запрета в robots.txt, метатега noindex, канонического адреса или малой ценности содержимого.

Алгоритм, обученный на оценках асессоров — специалистов, которые вручную размечают, насколько результаты отвечают запросам. Точных весов факторов не знает никто, включая сотрудников поисковых систем.