Исследование

Кто на самом деле сканирует ваш сайт в 2026: разбор логов реального интернет-магазина

11 минут чтения 1 просмотр
Обновлено · 22 июля
Кто на самом деле сканирует ваш сайт в 2026: разбор логов реального интернет-магазина

За три дня доступ к сайту одного B2B-интернет-магазина оборудования запросили боты под тринадцатью разными именами: GPTBot, ClaudeBot, PerplexityBot, Bytespider, CCBot, Googlebot и другие. Я выгрузила access-логи и проверила каждого – не по имени, а по IP-адресу. Оказалось, что верить User-Agent нельзя: 70% «Googlebot» – подделки, «Bytespider» целиком оказался самозванцем, а два IP-адреса из облака представлялись пятнадцатью разными ботами каждый. Ниже – полный разбор с цифрами, таблицами и методикой, которую можно повторить на своём сайте.

Методика: что и как я считала

Данные. Access-логи веб-сервера (формат nginx combined) реального B2B-интернет-магазина за 18–20 июля 2026 года – три полных дня, 16 705 запросов. Разобрано 100% строк. Четвёртый день (21 июля) из статистики исключён: на него пришлась разовая аномалия – массовый рендеринг сайта инфраструктурой Google и прогон SEO-краулера, которые исказили бы картину.

Верификация ботов. Имя бота (User-Agent) может написать себе кто угодно, поэтому каждый заметный бот проверялся по двум независимым признакам:

  • Официальные списки IP-адресов. Google, Bing, OpenAI и Perplexity публикуют машиночитаемые списки диапазонов своих краулеров. Если IP запроса не входит в список – это не их бот, что бы он о себе ни писал.
  • Обратный DNS (FCrDNS). У настоящего Googlebot обратная запись IP ведёт на crawl-*.googlebot.com, у Bingbot – на search.msn.com, у YandexBot – на spider.yandex.com. У самозванцев – на арендованные серверы или в никуда.

Собственные заходы владельца сайта и служебный трафик исключены из подсчёта людей.

Состав трафика: боты – это 39%

Из 16 705 запросов на живых людей пришлось около 10 100. Всё остальное – автоматика: поисковые краулеры, ИИ-боты, SEO-сервисы и большой пласт неопознанных и поддельных ботов.

Из чего состоит трафик сайта за три дня
16 705запросов за 3 дняЛюди – 10 117 (61%)Фейки и прочие боты – 3 776 (23%)SEO-краулеры – 1 392 (8%)Поисковики (наст.) – 900 (5%)ИИ-боты (наст.) – 520 (3%)

Обратите внимание на красный сегмент: подделки и неклассифицированные боты – это крупнейшая «нечеловеческая» категория. Больше, чем настоящие поисковики и настоящие ИИ-боты вместе взятые.

Заявлено vs подтверждено: главная таблица

Вот кто «приходил» на сайт по версии User-Agent – и сколько из этих запросов подтвердились проверкой по IP.

Что боты о себе заявляют – и что подтвердилось проверкой по IP
БотНазначениеЗапросов
(по имени)
Подтверждено
по IP
Доля подделокВердикт
Bytespiderобучение ИИ ByteDance (TikTok)10730~100%самозванец: весь трафик с арендованных серверов AWS в Сингапуре, а не из сетей ByteDance
«Googlebot»индексация Google89626870%609 запросов пришли с адресов вне всех сетей Google
Bingbotиндексация Bing4674670%полностью настоящий
ChatGPT-Userживые запросы пользователей ChatGPT26523711%настоящий – это реальные люди, которым ChatGPT прямо сейчас искал ответ на сайте
CCBotCommon Crawl: датасеты, на которых учатся почти все LLM222~205вероятно настоящий: идёт из региона AWS, где размещён Common Crawl (официального списка IP у проекта нет)
OAI-SearchBotиндекс ChatGPT Search432640%настоящий, но почти половина запросов – имитация
GPTBotобучение моделей OpenAI403122%настоящий
PerplexityBotиндекс Perplexity26485%почти весь трафик под этим именем – подделка
Perplexity-Userживые запросы пользователей Perplexity170100%все подделки (проверено по отдельному официальному списку Perplexity)
ClaudeBot и Claude-*обучение и поиск Anthropic~650~100%весь трафик – с чужого облака; Anthropic не публикует список IP, но с Google Cloud её боты не ходят
Запросов за 3 дня: серым – заявлено (по User-Agent), фиолетовым – подтверждено по IP
Bytespider10730«Googlebot»896268Bingbot467467ChatGPT-User265237CCBot222205OAI-SearchBot4326GPTBot4031PerplexityBot264

Самый громкий несостоявшийся заголовок этого исследования: «ИИ-бот TikTok сканирует сайт активнее Googlebot». По сырым логам это чистая правда – 1073 запроса Bytespider против 896 у Googlebot. Но проверка IP не подтвердила ни одного запроса Bytespider. Если бы я поверила User-Agent, вы бы сейчас читали эффектную, но ложную сенсацию.

Два IP – тридцать личностей

Гвоздь исследования нашёлся, когда я сгруппировала запросы по IP-адресам. Два адреса из Google Cloud – 35.199.x.x и 34.116.x.x – представлялись пятнадцатью разными ботами каждый: GPTBot, ClaudeBot, Googlebot, Bytespider, PerplexityBot, CCBot, Amazonbot, cohere-ai и так далее. Ещё один адрес из сети Cloudflare сменил одиннадцать масок.

Один сервер физически не может быть пятнадцатью ботами разных компаний. Это либо сканер, перебирающий User-Agent в поисках слабых мест (какие маски сайт пускает, какие нет), либо чей-то «проверятель доступности для ИИ». Для владельца сайта вывод один: строка User-Agent – это просто текст, который пишет сам клиент. Доверять ей без проверки IP нельзя ни в аналитике, ни в настройках доступа.

Настоящая находка: ChatGPT уже приводит людей

Среди подтверждённого трафика самое ценное – 237 запросов ChatGPT-User с 71 уникального IP-адреса за три дня. Это не индексация и не обучение моделей. User-Agent ChatGPT-User означает: живой человек задал вопрос в ChatGPT, и тот в реальном времени пошёл на сайт за ответом.

Если сгруппировать эти запросы по времени, получаются 23 пользовательские сессии за три дня. Двадцать одна – точечные: человек что-то спросил, ChatGPT заглянул на одну-две страницы и ушёл. А две сессии – глубокие, по 78 и 117 запросов подряд: ChatGPT методично обходил целые категории каталога, карточку за карточкой. Так выглядит агентный режим исследования – судя по тематике, кто-то поручил ИИ собрать рынок по конкретному типу оборудования, и сайт стал одним из его источников.

Прямые визиты таких агентов не видны ни в Метрике, ни в GA4: счётчики срабатывают через JavaScript, который боты не выполняют. Панели аналитики показывают только следствия – переходы людей по ссылкам из ИИ-ответов (и то не все), а в Яндекс.Вебмастере недавно появился отчёт «Видимость сайта в Алисе AI». Полную же картину – кто, когда и какие страницы читал – даёт только access-лог.

Карта интересов: что ИИ берёт с сайта

Куда именно ходят подтверждённые ИИ-боты? Я разметила их успешные запросы по типам страниц:

Доля успешных запросов подтверждённых ИИ-ботов
Каталог и карточки товаров75%Статика (изображения, скрипты)10%Главная страница5%Статьи и новости4%Прочие страницы3%Страницы брендов2%

Три четверти интереса – карточки и категории каталога. ChatGPT-User зашёл в каталог 204 раза, а в статьи – только 8. Люди спрашивают у ChatGPT про конкретное оборудование – и он идёт за характеристиками, комплектацией и ценами прямо в карточки товаров. Perplexity ведёт себя наоборот: из его подтверждённых запросов все – к статьям и информационным страницам.

Практический вывод для B2B-сайтов: для видимости в ИИ-ответах в первую очередь важны полные, структурированные карточки товаров – характеристики, цены, наличие, разметка Schema.org (Product/Offer); как внедрить её без ошибок – в полном гайде по Schema.org. Блог работает на другой канал – его читает Perplexity и поисковые ИИ.

Бонус-наблюдение: сканеры в масках

Отдельная категория поддельных «ИИ-ботов» занималась не контентом: за три дня зафиксировано 57 запросов к служебным путям вида /.git, /.ssh, /.env, /secrets.json, /actuator – под именами «Claude», «Bytespider», «Perplexity» и даже «Googlebot». Это автоматический перебор типовых мест, где разработчики иногда забывают закрыть доступ к служебным файлам. Сайт ответил на все запросы отказом (404/403) – но сам факт показателен: маска ИИ-бота стала стандартным камуфляжем для сканеров уязвимостей, ведь «модного» бота блокируют реже.

Как проверить ботов на своём сайте

Методика воспроизводится за вечер, нужны только access-логи:

  1. Выгрузите логи за несколько дней из панели хостинга (часто хранятся всего 3–7 дней – не откладывайте).
  2. Соберите статистику по User-Agent: сколько запросов у каждого бота, с каких IP.
  3. Сверьте IP с официальными списками – они публикуются в открытом виде (таблица со ссылками ниже).
  4. Для остальных – обратный DNS: команда host <IP> должна вернуть домен владельца бота (например, spider.yandex.com), а прямая проверка этого домена – тот же IP.
  5. Ищите «мультиличности»: сгруппируйте запросы по IP и посмотрите, сколько разных User-Agent приходит с одного адреса. Больше двух-трёх – почти наверняка сканер.

Официальные списки IP-адресов ботов

Официальные списки IP-адресов: где проверить любого бота
КомпанияБотОфициальный список IP
OpenAIGPTBotopenai.com/gptbot.json
ChatGPT-Useropenai.com/chatgpt-user.json
OAI-SearchBotopenai.com/searchbot.json
GoogleGooglebotdevelopers.google.com/…/googlebot.json
служебные краулеры…/special-crawlers.json
фетчеры по запросу…/user-triggered-fetchers.json
MicrosoftBingbotbing.com/toolbox/bingbot.json
PerplexityPerplexityBotperplexity.ai/perplexitybot.json
Perplexity-Userperplexity.ai/perplexity-user.json
AnthropicClaudeBotофициального списка нет – только проверка через обратный DNS
ЯндексYandexBotсписка нет – обратный DNS должен вести на spider.yandex.com

Что делать с результатами – зависит от целей: настоящих ИИ-ботов, которые приводят людей (ChatGPT-User, OAI-SearchBot), стоит беречь и кормить структурированным контентом; подтверждённых самозванцев – ограничивать по IP-диапазонам, а не по User-Agent, который они сменят за минуту.

Выводы

  • Боты – 39% трафика обычного B2B-сайта, и это норма 2026 года.
  • User-Agent без проверки IP не значит ничего: 70% «Googlebot» и почти 100% «Bytespider» на исследованном сайте – подделки.
  • Реальный ИИ-трафик скромнее сырых цифр, но он существенный и растёт: 237 подтверждённых визитов ChatGPT-User за 3 дня – это живые люди, которых не видит веб-аналитика.
  • ИИ-ассистенты используют B2B-сайт как товарный справочник: 75% их интереса – каталог, а не статьи. Инвестируйте в карточки товаров.
  • Маска ИИ-бота – новый камуфляж сканеров уязвимостей. Проверяйте, чем сервер отвечает на запросы к служебным путям.

Это первый срез наблюдений. Через месяц планирую повторить замер на том же сайте и посмотреть динамику: растёт ли доля ChatGPT-User и меняется ли поведение самозванцев. Если хотите такой же разбор для своего сайта – начните с бесплатной AI-диагностики или напишите мне.

Частые вопросы

Как отличить настоящего ИИ-бота от подделки?

Только по IP-адресу. Google, Bing, OpenAI и Perplexity публикуют официальные списки диапазонов своих краулеров – если IP запроса не входит в список, это самозванец. Для ботов без официального списка используется обратный DNS: запись должна вести на домен владельца бота.

Что такое ChatGPT-User и чем он отличается от GPTBot?

GPTBot собирает страницы для обучения моделей OpenAI, OAI-SearchBot строит индекс ChatGPT Search, а ChatGPT-User приходит, когда живой человек задал вопрос в ChatGPT и тот в реальном времени читает сайт для ответа. ChatGPT-User – это фактически визит потенциального клиента.

Почему ИИ-трафик не виден в Яндекс.Метрике и GA4?

Счётчики веб-аналитики работают через JavaScript, а боты и ИИ-агенты его не выполняют. Единственное место, где виден весь ИИ-трафик, – access-логи сервера.

Нужно ли блокировать поддельных ботов?

Подтверждённых самозванцев имеет смысл ограничивать по IP-диапазонам: блокировка по User-Agent бесполезна, имя они сменят мгновенно. Настоящих ИИ-ботов, которые приводят людей, блокировать не стоит – вы потеряете видимость в ИИ-ответах.

Стоит ли пускать на сайт GPTBot и CCBot, если они собирают данные для обучения?

Это осознанный выбор: краулеры обучения тратят ресурсы сервера и используют контент, но присутствие в обучающих данных и индексах повышает шанс, что ИИ будет упоминать и рекомендовать ваш сайт. Для коммерческого сайта видимость обычно ценнее.

На сайте много ботов – что делать?

Сначала посчитать и верифицировать: какая доля трафика на ботов, кто из них настоящий. Полезных (поисковики, ИИ-агенты с живыми пользователями) – оставить; подтверждённых самозванцев и агрессивные сканеры – ограничить по IP-диапазонам; и обязательно проверить, что сервер отвечает 404/403 на запросы к служебным путям.

Зачем боты вообще заходят на сайт?

С разными целями: поисковики строят индекс, ИИ-краулеры собирают данные для обучения и отвечают пользователям, SEO-сервисы анализируют ссылки и позиции, а сканеры ищут уязвимости и контент для парсинга. В этом исследовании боты дали 39% всех запросов.

Валентина Меланина

Хотите так же для вашего сайта?

Проверю AI-видимость вашего сайта и покажу точки роста

Если хотите понять, цитируют ли нейросети ваш сайт и что исправить — начнём с аудита.

Открытые замеры

Рейтинг AI-видимости: Velo Score™ Lite

Кого нейросети уже рекомендуют в нише — открытые данные и проверяемые формулы. Первый замер — многопрофильные клиники Москвы.

Открыть рейтинг
Топ клиник Москвы Velo Lite · 0–80
  1. 1СМ-Клиника58
  2. 2GMS Clinic57
  3. 3Медси54
  4. 4Семейный доктор51
  5. 5Бест Клиник47