Когда пользователь вводит запрос, Google и Яндекс не сканируют интернет заново – они ищут по заранее собранной базе. Классическая аналогия – библиотечный каталог: книга – это веб-страница, а карточка в каталоге – запись в индексе, где хранятся URL, title, метаданные, структурированное содержимое, ссылки и разметка Schema.org. Отсюда главное практическое следствие: страницы, которой нет в индексе, для поиска не существует, каким бы полезным ни был её контент. Индекс Google, по официальной документации, хранится на тысячах компьютеров и постоянно обновляется, но попадание в него не гарантировано – система сама решает, какие страницы допустить в базу. Управлять этим процессом помогают sitemap.xml, директивы robots.txt и noindex, а на больших сайтах – ещё и crawl budget.
Как это работает
Путь страницы от публикации до выдачи проходит четыре этапа.
- Сканирование – краулер (Googlebot, робот Яндекса) находит URL по ссылкам и sitemap.xml, а Яндекс – ещё и по данным Метрики, затем загружает страницу. Обходятся страницы с HTTP-кодом 200; ответы 4XX и 5XX Яндекс исключает из поиска.
- Рендеринг – Google отрисовывает страницу и выполняет JavaScript в актуальной версии Chrome, поэтому контент, который добавляют скрипты, тоже попадает в обработку.
- Индексирование – система анализирует текст, title, description и разметку Schema.org, группирует дубли, выбирает каноническую версию и записывает страницу в базу. Здесь же отсеиваются дубли и закрытые от индексирования страницы.
- Ранжирование – при конкретном запросе алгоритмы сортируют уже проиндексированные страницы по релевантности и формируют выдачу.
В официальных справках схема описана по-разному: Google выделяет три этапа (сканирование, индексирование, показ результатов), Яндекс – четыре (обход, загрузка и обработка, формирование базы поиска, формирование результатов), но механика одна и та же.
Инвертированный индекс: почему поиск занимает доли секунды
Искать перебором по миллиардам документов невозможно, поэтому ядро поискового индекса – инвертированный индекс: структура данных, где каждому слову соответствует список документов, в которых оно встречается (posting list). Возьмём три страницы: «Быстрый рыжий кот» (1), «Ленивая собака» (2), «Рыжая собака» (3). Инвертированный индекс для них выглядит так:
быстрый → [1]
рыжий → [1, 3]
кот → [1]
ленивый → [2]
собака → [2, 3]Запрос «рыжая собака» сводится к пересечению двух готовых списков – [1, 3] и [2, 3] – и мгновенно находит документ 3. Индексы бывают record-level (хранят только номера документов) и word-level (дополнительно позиции слов – это нужно для поиска по точным фразам). Плата за скорость – затраты на хранение и обслуживание структуры: сжатие инвертированных индексов – отдельная инженерная дисциплина. Русскоязычные SEO-словари этот механизм обычно не описывают, хотя именно он объясняет, как выдача формируется за доли секунды.
Индексация и ранжирование – в чём разница
Эти этапы регулярно путают, хотя работают они по-разному и управляются разными инструментами.
| Критерий | Индексация | Ранжирование |
|---|---|---|
| Что происходит | Страница попадает в базу поиска | Проиндексированные страницы сортируются по релевантности |
| Когда | Постоянно, независимо от запросов | В момент конкретного запроса |
| Результат | «Да/нет»: страница может участвовать в поиске | Позиция в выдаче |
| Инструменты | robots.txt, noindex, canonical, sitemap.xml | Качество контента, ссылки, соответствие запросу |
| Где проверять | Яндекс Вебмастер, Google Search Console | Позиции в выдаче по запросам |
Индексация – необходимое, но не достаточное условие видимости: Google прямо пишет, что не гарантирует индексирование всех обработанных страниц, а попадание в базу не гарантирует показа в топе.
Зачем это нужно
Для владельца сайта и SEO-специалиста индекс – управляемая зона: набор технических инструментов определяет, что попадёт в базу, а что нет.
- robots.txt – разрешает или запрещает обход разделов сайта ещё на этапе сканирования.
- Метатег noindex – страница обходится роботом, но в базу поиска не попадает: точечное исключение служебных страниц, фильтров и дублей.
- rel="canonical" – указывает основную версию среди дублей; Google группирует дубликаты и выбирает каноническую страницу с учётом сотен факторов.
- sitemap.xml – список URL для обхода, ускоряет обнаружение новых страниц.
- Ускорители – инструмент «Переобход страниц» в Яндекс Вебмастере и протокол IndexNow: сообщают о новой или изменённой странице, не дожидаясь планового визита робота.
Сроки: по справке Яндекс Вебмастера, после первичного обхода страницы могут появиться в поиске в течение примерно двух недель; Google, по данным SEO-практики, индексирует новые страницы за 3–7 дней. Второй важный нюанс – mobile-first indexing: при индексировании и ранжировании Google использует мобильную версию сайта, поэтому мобильная и десктопная версии должны содержать одинаковый контент, метатеги и структурированные данные. Типичная ошибка – noindex, случайно оставленный только в мобильной версии.
Пример
Диагностика «страница не находится в поиске» – типовая задача. Порядок проверки:
- Оператор
site:domain.ruв строке поиска – грубая оценка, сколько страниц сайта в индексе. - Яндекс Вебмастер: «Страницы в поиске» показывает, что в базе; «Проверить URL» – статус конкретной страницы; «Статистика обхода» – заходил ли робот вообще.
- Google Search Console: инструмент проверки URL показывает, просканирована ли страница, проиндексирована ли и какая версия выбрана канонической.
- Если страницы в индексе нет – проверить по цепочке: HTTP-код ответа (нужен 200), запреты в robots.txt, метатег noindex, canonical на другую страницу, наличие URL в sitemap.xml и внутренние ссылки на страницу.
В 2026 году у этой проверки появилось второе назначение – видимость в AI-поиске. По документации Google, контент попадает в AI Overviews и AI Mode, только если страница проиндексирована и допускает показ сниппетов; специальная разметка не нужна – AI-функции работают поверх обычного поискового индекса, а ограничить использование контента можно директивами nosnippet, data-nosnippet, max-snippet и noindex. RAG-системы нейропоиска строят собственные индексы по той же логике: документы режутся на фрагменты, превращаются в векторы (embeddings) и записываются в векторную базу – по сути, эволюция инвертированного индекса. Поэтому классическая работа с индексацией – фундамент AI-видимости и GEO: сайт, которого нет в индексе, не процитирует ни поисковик, ни нейросеть.