Поисковый индекс

Поисковый индекс – база данных поисковой системы, где хранится информация о просканированных страницах. Google и Яндекс ищут по индексу, а не по интернету напрямую: страница вне индекса не может появиться в выдаче.

4 минуты чтения

Когда пользователь вводит запрос, Google и Яндекс не сканируют интернет заново – они ищут по заранее собранной базе. Классическая аналогия – библиотечный каталог: книга – это веб-страница, а карточка в каталоге – запись в индексе, где хранятся URL, title, метаданные, структурированное содержимое, ссылки и разметка Schema.org. Отсюда главное практическое следствие: страницы, которой нет в индексе, для поиска не существует, каким бы полезным ни был её контент. Индекс Google, по официальной документации, хранится на тысячах компьютеров и постоянно обновляется, но попадание в него не гарантировано – система сама решает, какие страницы допустить в базу. Управлять этим процессом помогают sitemap.xml, директивы robots.txt и noindex, а на больших сайтах – ещё и crawl budget.

Как это работает

Путь страницы от публикации до выдачи проходит четыре этапа.

  1. Сканирование – краулер (Googlebot, робот Яндекса) находит URL по ссылкам и sitemap.xml, а Яндекс – ещё и по данным Метрики, затем загружает страницу. Обходятся страницы с HTTP-кодом 200; ответы 4XX и 5XX Яндекс исключает из поиска.
  2. Рендеринг – Google отрисовывает страницу и выполняет JavaScript в актуальной версии Chrome, поэтому контент, который добавляют скрипты, тоже попадает в обработку.
  3. Индексирование – система анализирует текст, title, description и разметку Schema.org, группирует дубли, выбирает каноническую версию и записывает страницу в базу. Здесь же отсеиваются дубли и закрытые от индексирования страницы.
  4. Ранжирование – при конкретном запросе алгоритмы сортируют уже проиндексированные страницы по релевантности и формируют выдачу.

В официальных справках схема описана по-разному: Google выделяет три этапа (сканирование, индексирование, показ результатов), Яндекс – четыре (обход, загрузка и обработка, формирование базы поиска, формирование результатов), но механика одна и та же.

Инвертированный индекс: почему поиск занимает доли секунды

Искать перебором по миллиардам документов невозможно, поэтому ядро поискового индекса – инвертированный индекс: структура данных, где каждому слову соответствует список документов, в которых оно встречается (posting list). Возьмём три страницы: «Быстрый рыжий кот» (1), «Ленивая собака» (2), «Рыжая собака» (3). Инвертированный индекс для них выглядит так:

быстрый → [1]
рыжий   → [1, 3]
кот     → [1]
ленивый → [2]
собака  → [2, 3]

Запрос «рыжая собака» сводится к пересечению двух готовых списков – [1, 3] и [2, 3] – и мгновенно находит документ 3. Индексы бывают record-level (хранят только номера документов) и word-level (дополнительно позиции слов – это нужно для поиска по точным фразам). Плата за скорость – затраты на хранение и обслуживание структуры: сжатие инвертированных индексов – отдельная инженерная дисциплина. Русскоязычные SEO-словари этот механизм обычно не описывают, хотя именно он объясняет, как выдача формируется за доли секунды.

Индексация и ранжирование – в чём разница

Эти этапы регулярно путают, хотя работают они по-разному и управляются разными инструментами.

КритерийИндексацияРанжирование
Что происходитСтраница попадает в базу поискаПроиндексированные страницы сортируются по релевантности
КогдаПостоянно, независимо от запросовВ момент конкретного запроса
Результат«Да/нет»: страница может участвовать в поискеПозиция в выдаче
Инструментыrobots.txt, noindex, canonical, sitemap.xmlКачество контента, ссылки, соответствие запросу
Где проверятьЯндекс Вебмастер, Google Search ConsoleПозиции в выдаче по запросам

Индексация – необходимое, но не достаточное условие видимости: Google прямо пишет, что не гарантирует индексирование всех обработанных страниц, а попадание в базу не гарантирует показа в топе.

Зачем это нужно

Для владельца сайта и SEO-специалиста индекс – управляемая зона: набор технических инструментов определяет, что попадёт в базу, а что нет.

  • robots.txt – разрешает или запрещает обход разделов сайта ещё на этапе сканирования.
  • Метатег noindex – страница обходится роботом, но в базу поиска не попадает: точечное исключение служебных страниц, фильтров и дублей.
  • rel="canonical" – указывает основную версию среди дублей; Google группирует дубликаты и выбирает каноническую страницу с учётом сотен факторов.
  • sitemap.xml – список URL для обхода, ускоряет обнаружение новых страниц.
  • Ускорители – инструмент «Переобход страниц» в Яндекс Вебмастере и протокол IndexNow: сообщают о новой или изменённой странице, не дожидаясь планового визита робота.

Сроки: по справке Яндекс Вебмастера, после первичного обхода страницы могут появиться в поиске в течение примерно двух недель; Google, по данным SEO-практики, индексирует новые страницы за 3–7 дней. Второй важный нюанс – mobile-first indexing: при индексировании и ранжировании Google использует мобильную версию сайта, поэтому мобильная и десктопная версии должны содержать одинаковый контент, метатеги и структурированные данные. Типичная ошибка – noindex, случайно оставленный только в мобильной версии.

Пример

Диагностика «страница не находится в поиске» – типовая задача. Порядок проверки:

  1. Оператор site:domain.ru в строке поиска – грубая оценка, сколько страниц сайта в индексе.
  2. Яндекс Вебмастер: «Страницы в поиске» показывает, что в базе; «Проверить URL» – статус конкретной страницы; «Статистика обхода» – заходил ли робот вообще.
  3. Google Search Console: инструмент проверки URL показывает, просканирована ли страница, проиндексирована ли и какая версия выбрана канонической.
  4. Если страницы в индексе нет – проверить по цепочке: HTTP-код ответа (нужен 200), запреты в robots.txt, метатег noindex, canonical на другую страницу, наличие URL в sitemap.xml и внутренние ссылки на страницу.

В 2026 году у этой проверки появилось второе назначение – видимость в AI-поиске. По документации Google, контент попадает в AI Overviews и AI Mode, только если страница проиндексирована и допускает показ сниппетов; специальная разметка не нужна – AI-функции работают поверх обычного поискового индекса, а ограничить использование контента можно директивами nosnippet, data-nosnippet, max-snippet и noindex. RAG-системы нейропоиска строят собственные индексы по той же логике: документы режутся на фрагменты, превращаются в векторы (embeddings) и записываются в векторную базу – по сути, эволюция инвертированного индекса. Поэтому классическая работа с индексацией – фундамент AI-видимости и GEO: сайт, которого нет в индексе, не процитирует ни поисковик, ни нейросеть.

Частые вопросы

Чем индексация отличается от ранжирования?

Индексация – попадание страницы в базу данных поисковой системы; это бинарное состояние «в базе / не в базе», которое происходит независимо от запросов. Ранжирование – сортировка уже проиндексированных страниц по релевантности в момент конкретного запроса. Управляются они разными инструментами: индексацией – robots.txt, noindex, canonical и sitemap.xml, ранжированием – качество контента и соответствие запросу.

Как проверить, есть ли страница в индексе Яндекса и Google?

Быстрый способ – оператор site:domain.ru в строке поиска. Точный: в Яндекс Вебмастере – разделы «Страницы в поиске» и «Проверить URL», в Google Search Console – инструмент проверки URL, который показывает статус сканирования, индексации и выбранную каноническую версию. Отчёт «Статистика обхода» в Вебмастере покажет, заходил ли робот на сайт вообще.

Почему страница просканирована, но не проиндексирована?

Индексирование не гарантировано: Google прямо пишет, что не все обработанные страницы попадают в индекс. Типичные причины – низкое качество контента, дубли (канонической выбрана другая страница), метатег noindex, запреты в robots-директивах или недоступность страницы при повторном обращении. Точный статус покажут инструмент проверки URL в Search Console и «Проверить URL» в Яндекс Вебмастере.

Как быстро новая страница попадает в индекс и как это ускорить?

По справке Яндекс Вебмастера страницы могут появиться в поиске в течение примерно двух недель после первичного обхода; Google, по данным SEO-практики, индексирует новые страницы за 3–7 дней. Ускорители: актуальный sitemap.xml, внутренние ссылки с уже проиндексированных страниц, инструмент «Переобход страниц» в Вебмастере и протокол IndexNow. Для Яндекса дополнительным сигналом об обновлениях служат данные Яндекс Метрики.

Что такое инвертированный индекс простыми словами?

Это структура данных вида «слово → список документов, где оно встречается», как предметный указатель в конце книги. Поиск по запросу сводится к пересечению готовых списков, а не к перебору всех документов – поэтому выдача формируется за доли секунды. Word-level-вариант дополнительно хранит позиции слов, что позволяет искать точные фразы.

Попадёт ли сайт в ответы нейросетей, если его нет в поисковом индексе?

В AI Overviews и AI Mode Google – нет: по официальной документации контент попадает туда, только если страница проиндексирована и допускает показ сниппетов. Специальной разметки для AI-функций не требуется – они работают поверх обычного поискового индекса. Поэтому базовая индексация – обязательное условие AI-видимости сайта.

Что хранится в поисковом индексе?

Не копия интернета, а обработанная информация о страницах: URL, title и description, структурированное содержимое (заголовки, абзацы, списки), данные об изображениях и видео, внутренние и внешние ссылки, разметка Schema.org. В базу попадают не все страницы: дубли, автогенерируемый и закрытый от индексирования контент отсеиваются при обработке.

Материалы по теме

Валентина Меланина

Нужна консультация?

Разберу ваш сайт и покажу точки роста

Если хотите понять, как этот термин применить к вашему проекту — начнём с аудита.