Кто на самом деле сканирует ваш сайт в 2026: разбор логов реального интернет-магазина
Исследование11 мин 149 Обновлено 13 августа Сложность: Средняя
TL;DR
- Боты дают 39% трафика B2B-сайта; крупнейшая группа – подделки и неопознанная автоматика.
- 70% запросов «Googlebot» и ~100% «Bytespider» не подтвердились проверкой по IP – это самозванцы.
- Два IP из облака представлялись 15 разными ботами каждый – User-Agent можно только проверять, но не верить ему.
- ChatGPT-User – 237 подтверждённых запросов за 3 дня: живые люди, которым ChatGPT искал ответ на сайте. Веб-аналитика их не видит.
- 75% интереса настоящих ИИ-ботов – карточки товаров, а не статьи: ИИ использует сайт как товарный справочник.
За три дня доступ к сайту одного B2B-интернет-магазина оборудования запросили боты под тринадцатью разными именами: GPTBot, ClaudeBot, PerplexityBot, Bytespider, CCBot, Googlebot и другие. Я выгрузила access-логи и проверила каждого – не по имени, а по IP-адресу. Оказалось, что верить User-Agent нельзя: 70% «Googlebot» – подделки, «Bytespider» целиком оказался самозванцем, а два IP-адреса из облака представлялись пятнадцатью разными ботами каждый. Ниже – полный разбор с цифрами, таблицами и методикой, которую можно повторить на своём сайте.
Методика: что и как я считала
Данные. Access-логи веб-сервера (формат nginx combined) реального B2B-интернет-магазина за 18–20 июля 2026 года – три полных дня, 16 705 запросов. Разобрано 100% строк. Четвёртый день (21 июля) из статистики исключён: на него пришлась разовая аномалия – массовый рендеринг сайта инфраструктурой Google и прогон SEO-краулера, которые исказили бы картину.
Верификация ботов. Имя бота (User-Agent) может написать себе кто угодно, поэтому каждый заметный бот проверялся по двум независимым признакам:
- Официальные списки IP-адресов. Google, Bing, OpenAI и Perplexity публикуют машиночитаемые списки диапазонов своих краулеров. Если IP запроса не входит в список – это не их бот, что бы он о себе ни писал.
- Обратный DNS (FCrDNS). У настоящего Googlebot обратная запись IP ведёт на
crawl-*.googlebot.com, у Bingbot – наsearch.msn.com, у YandexBot – наspider.yandex.com. У самозванцев – на арендованные серверы или в никуда.
Собственные заходы владельца сайта и служебный трафик исключены из подсчёта людей.
Состав трафика: боты – это 39%
Из 16 705 запросов на живых людей пришлось около 10 100. Всё остальное – автоматика: поисковые краулеры, ИИ-боты, SEO-сервисы и большой пласт неопознанных и поддельных ботов.
Обратите внимание на красный сегмент: подделки и неклассифицированные боты – это крупнейшая «нечеловеческая» категория. Больше, чем настоящие поисковики и настоящие ИИ-боты вместе взятые.
Заявлено vs подтверждено: главная таблица
Вот кто «приходил» на сайт по версии User-Agent – и сколько из этих запросов подтвердились проверкой по IP.
| Бот | Назначение | Запросов (по имени) | Подтверждено по IP | Доля подделок | Вердикт |
|---|---|---|---|---|---|
| Bytespider | обучение ИИ ByteDance (TikTok) | 1073 | 0 | ~100% | самозванец: весь трафик с арендованных серверов AWS в Сингапуре, а не из сетей ByteDance |
| «Googlebot» | индексация Google | 896 | 268 | 70% | 609 запросов пришли с адресов вне всех сетей Google |
| Bingbot | индексация Bing | 467 | 467 | 0% | полностью настоящий |
| ChatGPT-User | живые запросы пользователей ChatGPT | 265 | 237 | 11% | настоящий – это реальные люди, которым ChatGPT прямо сейчас искал ответ на сайте |
| CCBot | Common Crawl: датасеты, на которых учатся почти все LLM | 222 | ~205 | – | вероятно настоящий: идёт из региона AWS, где размещён Common Crawl (официального списка IP у проекта нет) |
| OAI-SearchBot | индекс ChatGPT Search | 43 | 26 | 40% | настоящий, но почти половина запросов – имитация |
| GPTBot | обучение моделей OpenAI | 40 | 31 | 22% | настоящий |
| PerplexityBot | индекс Perplexity | 26 | 4 | 85% | почти весь трафик под этим именем – подделка |
| Perplexity-User | живые запросы пользователей Perplexity | 17 | 0 | 100% | все подделки (проверено по отдельному официальному списку Perplexity) |
| ClaudeBot и Claude-* | обучение и поиск Anthropic | ~65 | 0 | ~100% | весь трафик – с чужого облака; Anthropic не публикует список IP, но с Google Cloud её боты не ходят |
Самый громкий несостоявшийся заголовок этого исследования: «ИИ-бот TikTok сканирует сайт активнее Googlebot». По сырым логам это чистая правда – 1073 запроса Bytespider против 896 у Googlebot. Но проверка IP не подтвердила ни одного запроса Bytespider. Если бы я поверила User-Agent, вы бы сейчас читали эффектную, но ложную сенсацию.
Два IP – тридцать личностей
Гвоздь исследования нашёлся, когда я сгруппировала запросы по IP-адресам. Два адреса из Google Cloud – 35.199.x.x и 34.116.x.x – представлялись пятнадцатью разными ботами каждый: GPTBot, ClaudeBot, Googlebot, Bytespider, PerplexityBot, CCBot, Amazonbot, cohere-ai и так далее. Ещё один адрес из сети Cloudflare сменил одиннадцать масок.
Один сервер физически не может быть пятнадцатью ботами разных компаний. Это либо сканер, перебирающий User-Agent в поисках слабых мест (какие маски сайт пускает, какие нет), либо чей-то «проверятель доступности для ИИ». Для владельца сайта вывод один: строка User-Agent – это просто текст, который пишет сам клиент. Доверять ей без проверки IP нельзя ни в аналитике, ни в настройках доступа.
Настоящая находка: ChatGPT уже приводит людей
Среди подтверждённого трафика самое ценное – 237 запросов ChatGPT-User с 71 уникального IP-адреса за три дня. Это не индексация и не обучение моделей. User-Agent ChatGPT-User означает: живой человек задал вопрос в ChatGPT, и тот в реальном времени пошёл на сайт за ответом.
Если сгруппировать эти запросы по времени, получаются 23 пользовательские сессии за три дня. Двадцать одна – точечные: человек что-то спросил, ChatGPT заглянул на одну-две страницы и ушёл. А две сессии – глубокие, по 78 и 117 запросов подряд: ChatGPT методично обходил целые категории каталога, карточку за карточкой. Так выглядит агентный режим исследования – судя по тематике, кто-то поручил ИИ собрать рынок по конкретному типу оборудования, и сайт стал одним из его источников.
Прямые визиты таких агентов не видны ни в Метрике, ни в GA4: счётчики срабатывают через JavaScript, который боты не выполняют. Панели аналитики показывают только следствия – переходы людей по ссылкам из ИИ-ответов (и то не все), а в Яндекс.Вебмастере недавно появился отчёт «Видимость сайта в Алисе AI». Полную же картину – кто, когда и какие страницы читал – даёт только access-лог.
Карта интересов: что ИИ берёт с сайта
Куда именно ходят подтверждённые ИИ-боты? Я разметила их успешные запросы по типам страниц:
Три четверти интереса – карточки и категории каталога. ChatGPT-User зашёл в каталог 204 раза, а в статьи – только 8. Люди спрашивают у ChatGPT про конкретное оборудование – и он идёт за характеристиками, комплектацией и ценами прямо в карточки товаров. Perplexity ведёт себя наоборот: из его подтверждённых запросов все – к статьям и информационным страницам.
Практический вывод для B2B-сайтов: для видимости в ИИ-ответах в первую очередь важны полные, структурированные карточки товаров – характеристики, цены, наличие, разметка Schema.org (Product/Offer); как внедрить её без ошибок – в полном гайде по Schema.org. Блог работает на другой канал – его читает Perplexity и поисковые ИИ.
Бонус-наблюдение: сканеры в масках
Отдельная категория поддельных «ИИ-ботов» занималась не контентом: за три дня зафиксировано 57 запросов к служебным путям вида /.git, /.ssh, /.env, /secrets.json, /actuator – под именами «Claude», «Bytespider», «Perplexity» и даже «Googlebot». Это автоматический перебор типовых мест, где разработчики иногда забывают закрыть доступ к служебным файлам. Сайт ответил на все запросы отказом (404/403) – но сам факт показателен: маска ИИ-бота стала стандартным камуфляжем для сканеров уязвимостей, ведь «модного» бота блокируют реже.
Как проверить ботов на своём сайте
Методика воспроизводится за вечер, нужны только access-логи:
- Выгрузите логи за несколько дней из панели хостинга (часто хранятся всего 3–7 дней – не откладывайте).
- Соберите статистику по User-Agent: сколько запросов у каждого бота, с каких IP.
- Сверьте IP с официальными списками – они публикуются в открытом виде (таблица со ссылками ниже).
- Для остальных – обратный DNS: команда
host <IP>должна вернуть домен владельца бота (например,spider.yandex.com), а прямая проверка этого домена – тот же IP. - Ищите «мультиличности»: сгруппируйте запросы по IP и посмотрите, сколько разных User-Agent приходит с одного адреса. Больше двух-трёх – почти наверняка сканер.
Официальные списки IP-адресов ботов
| Компания | Бот | Официальный список IP |
|---|---|---|
| OpenAI | GPTBot | openai.com/gptbot.json |
| OpenAI | ChatGPT-User | openai.com/chatgpt-user.json |
| OpenAI | OAI-SearchBot | openai.com/searchbot.json |
| Googlebot | developers.google.com/…/googlebot.json | |
| служебные краулеры | …/special-crawlers.json | |
| фетчеры по запросу | …/user-triggered-fetchers.json | |
| Microsoft | Bingbot | bing.com/toolbox/bingbot.json |
| Perplexity | PerplexityBot | perplexity.ai/perplexitybot.json |
| Perplexity | Perplexity-User | perplexity.ai/perplexity-user.json |
| Anthropic | ClaudeBot | официального списка нет – только проверка через обратный DNS |
| Яндекс | YandexBot | списка нет – обратный DNS должен вести на spider.yandex.com |
Что делать с результатами – зависит от целей: настоящих ИИ-ботов, которые приводят людей (ChatGPT-User, OAI-SearchBot), стоит беречь и кормить структурированным контентом; подтверждённых самозванцев – ограничивать по IP-диапазонам, а не по User-Agent, который они сменят за минуту.
Выводы
- Боты – 39% трафика обычного B2B-сайта, и это норма 2026 года.
- User-Agent без проверки IP не значит ничего: 70% «Googlebot» и почти 100% «Bytespider» на исследованном сайте – подделки.
- Реальный ИИ-трафик скромнее сырых цифр, но он существенный и растёт: 237 подтверждённых визитов ChatGPT-User за 3 дня – это живые люди, которых не видит веб-аналитика.
- ИИ-ассистенты используют B2B-сайт как товарный справочник: 75% их интереса – каталог, а не статьи. Инвестируйте в карточки товаров.
- Маска ИИ-бота – новый камуфляж сканеров уязвимостей. Проверяйте, чем сервер отвечает на запросы к служебным путям.
Это первый срез наблюдений. Через месяц планирую повторить замер на том же сайте и посмотреть динамику: растёт ли доля ChatGPT-User и меняется ли поведение самозванцев. Если хотите такой же разбор для своего сайта – начните с бесплатной AI-диагностики или напишите мне.
Частые вопросы
Как отличить настоящего ИИ-бота от подделки?
Только по IP-адресу. Google, Bing, OpenAI и Perplexity публикуют официальные списки диапазонов своих краулеров – если IP запроса не входит в список, это самозванец. Для ботов без официального списка используется обратный DNS: запись должна вести на домен владельца бота.
Что такое ChatGPT-User и чем он отличается от GPTBot?
GPTBot собирает страницы для обучения моделей OpenAI, OAI-SearchBot строит индекс ChatGPT Search, а ChatGPT-User приходит, когда живой человек задал вопрос в ChatGPT и тот в реальном времени читает сайт для ответа. ChatGPT-User – это фактически визит потенциального клиента.
Почему ИИ-трафик не виден в Яндекс.Метрике и GA4?
Счётчики веб-аналитики работают через JavaScript, а боты и ИИ-агенты его не выполняют. Единственное место, где виден весь ИИ-трафик, – access-логи сервера.
Нужно ли блокировать поддельных ботов?
Подтверждённых самозванцев имеет смысл ограничивать по IP-диапазонам: блокировка по User-Agent бесполезна, имя они сменят мгновенно. Настоящих ИИ-ботов, которые приводят людей, блокировать не стоит – вы потеряете видимость в ИИ-ответах.
Стоит ли пускать на сайт GPTBot и CCBot, если они собирают данные для обучения?
Это осознанный выбор: краулеры обучения тратят ресурсы сервера и используют контент, но присутствие в обучающих данных и индексах повышает шанс, что ИИ будет упоминать и рекомендовать ваш сайт. Для коммерческого сайта видимость обычно ценнее.
На сайте много ботов – что делать?
Сначала посчитать и верифицировать: какая доля трафика на ботов, кто из них настоящий. Полезных (поисковики, ИИ-агенты с живыми пользователями) – оставить; подтверждённых самозванцев и агрессивные сканеры – ограничить по IP-диапазонам; и обязательно проверить, что сервер отвечает 404/403 на запросы к служебным путям.
Зачем боты вообще заходят на сайт?
С разными целями: поисковики строят индекс, ИИ-краулеры собирают данные для обучения и отвечают пользователям, SEO-сервисы анализируют ссылки и позиции, а сканеры ищут уязвимости и контент для парсинга. В этом исследовании боты дали 39% всех запросов.
Материалы по теме
Что почитать дальше по этой теме.