За три дня доступ к сайту одного B2B-интернет-магазина оборудования запросили боты под тринадцатью разными именами: GPTBot, ClaudeBot, PerplexityBot, Bytespider, CCBot, Googlebot и другие. Я выгрузила access-логи и проверила каждого – не по имени, а по IP-адресу. Оказалось, что верить User-Agent нельзя: 70% «Googlebot» – подделки, «Bytespider» целиком оказался самозванцем, а два IP-адреса из облака представлялись пятнадцатью разными ботами каждый. Ниже – полный разбор с цифрами, таблицами и методикой, которую можно повторить на своём сайте.
Методика: что и как я считала
Данные. Access-логи веб-сервера (формат nginx combined) реального B2B-интернет-магазина за 18–20 июля 2026 года – три полных дня, 16 705 запросов. Разобрано 100% строк. Четвёртый день (21 июля) из статистики исключён: на него пришлась разовая аномалия – массовый рендеринг сайта инфраструктурой Google и прогон SEO-краулера, которые исказили бы картину.
Верификация ботов. Имя бота (User-Agent) может написать себе кто угодно, поэтому каждый заметный бот проверялся по двум независимым признакам:
- Официальные списки IP-адресов. Google, Bing, OpenAI и Perplexity публикуют машиночитаемые списки диапазонов своих краулеров. Если IP запроса не входит в список – это не их бот, что бы он о себе ни писал.
- Обратный DNS (FCrDNS). У настоящего Googlebot обратная запись IP ведёт на
crawl-*.googlebot.com, у Bingbot – наsearch.msn.com, у YandexBot – наspider.yandex.com. У самозванцев – на арендованные серверы или в никуда.
Собственные заходы владельца сайта и служебный трафик исключены из подсчёта людей.
Состав трафика: боты – это 39%
Из 16 705 запросов на живых людей пришлось около 10 100. Всё остальное – автоматика: поисковые краулеры, ИИ-боты, SEO-сервисы и большой пласт неопознанных и поддельных ботов.
Обратите внимание на красный сегмент: подделки и неклассифицированные боты – это крупнейшая «нечеловеческая» категория. Больше, чем настоящие поисковики и настоящие ИИ-боты вместе взятые.
Заявлено vs подтверждено: главная таблица
Вот кто «приходил» на сайт по версии User-Agent – и сколько из этих запросов подтвердились проверкой по IP.
| Бот | Назначение | Запросов (по имени) | Подтверждено по IP | Доля подделок | Вердикт |
|---|---|---|---|---|---|
| Bytespider | обучение ИИ ByteDance (TikTok) | 1073 | 0 | ~100% | самозванец: весь трафик с арендованных серверов AWS в Сингапуре, а не из сетей ByteDance |
| «Googlebot» | индексация Google | 896 | 268 | 70% | 609 запросов пришли с адресов вне всех сетей Google |
| Bingbot | индексация Bing | 467 | 467 | 0% | полностью настоящий |
| ChatGPT-User | живые запросы пользователей ChatGPT | 265 | 237 | 11% | настоящий – это реальные люди, которым ChatGPT прямо сейчас искал ответ на сайте |
| CCBot | Common Crawl: датасеты, на которых учатся почти все LLM | 222 | ~205 | – | вероятно настоящий: идёт из региона AWS, где размещён Common Crawl (официального списка IP у проекта нет) |
| OAI-SearchBot | индекс ChatGPT Search | 43 | 26 | 40% | настоящий, но почти половина запросов – имитация |
| GPTBot | обучение моделей OpenAI | 40 | 31 | 22% | настоящий |
| PerplexityBot | индекс Perplexity | 26 | 4 | 85% | почти весь трафик под этим именем – подделка |
| Perplexity-User | живые запросы пользователей Perplexity | 17 | 0 | 100% | все подделки (проверено по отдельному официальному списку Perplexity) |
| ClaudeBot и Claude-* | обучение и поиск Anthropic | ~65 | 0 | ~100% | весь трафик – с чужого облака; Anthropic не публикует список IP, но с Google Cloud её боты не ходят |
Самый громкий несостоявшийся заголовок этого исследования: «ИИ-бот TikTok сканирует сайт активнее Googlebot». По сырым логам это чистая правда – 1073 запроса Bytespider против 896 у Googlebot. Но проверка IP не подтвердила ни одного запроса Bytespider. Если бы я поверила User-Agent, вы бы сейчас читали эффектную, но ложную сенсацию.
Два IP – тридцать личностей
Гвоздь исследования нашёлся, когда я сгруппировала запросы по IP-адресам. Два адреса из Google Cloud – 35.199.x.x и 34.116.x.x – представлялись пятнадцатью разными ботами каждый: GPTBot, ClaudeBot, Googlebot, Bytespider, PerplexityBot, CCBot, Amazonbot, cohere-ai и так далее. Ещё один адрес из сети Cloudflare сменил одиннадцать масок.
Один сервер физически не может быть пятнадцатью ботами разных компаний. Это либо сканер, перебирающий User-Agent в поисках слабых мест (какие маски сайт пускает, какие нет), либо чей-то «проверятель доступности для ИИ». Для владельца сайта вывод один: строка User-Agent – это просто текст, который пишет сам клиент. Доверять ей без проверки IP нельзя ни в аналитике, ни в настройках доступа.
Настоящая находка: ChatGPT уже приводит людей
Среди подтверждённого трафика самое ценное – 237 запросов ChatGPT-User с 71 уникального IP-адреса за три дня. Это не индексация и не обучение моделей. User-Agent ChatGPT-User означает: живой человек задал вопрос в ChatGPT, и тот в реальном времени пошёл на сайт за ответом.
Если сгруппировать эти запросы по времени, получаются 23 пользовательские сессии за три дня. Двадцать одна – точечные: человек что-то спросил, ChatGPT заглянул на одну-две страницы и ушёл. А две сессии – глубокие, по 78 и 117 запросов подряд: ChatGPT методично обходил целые категории каталога, карточку за карточкой. Так выглядит агентный режим исследования – судя по тематике, кто-то поручил ИИ собрать рынок по конкретному типу оборудования, и сайт стал одним из его источников.
Прямые визиты таких агентов не видны ни в Метрике, ни в GA4: счётчики срабатывают через JavaScript, который боты не выполняют. Панели аналитики показывают только следствия – переходы людей по ссылкам из ИИ-ответов (и то не все), а в Яндекс.Вебмастере недавно появился отчёт «Видимость сайта в Алисе AI». Полную же картину – кто, когда и какие страницы читал – даёт только access-лог.
Карта интересов: что ИИ берёт с сайта
Куда именно ходят подтверждённые ИИ-боты? Я разметила их успешные запросы по типам страниц:
Три четверти интереса – карточки и категории каталога. ChatGPT-User зашёл в каталог 204 раза, а в статьи – только 8. Люди спрашивают у ChatGPT про конкретное оборудование – и он идёт за характеристиками, комплектацией и ценами прямо в карточки товаров. Perplexity ведёт себя наоборот: из его подтверждённых запросов все – к статьям и информационным страницам.
Практический вывод для B2B-сайтов: для видимости в ИИ-ответах в первую очередь важны полные, структурированные карточки товаров – характеристики, цены, наличие, разметка Schema.org (Product/Offer); как внедрить её без ошибок – в полном гайде по Schema.org. Блог работает на другой канал – его читает Perplexity и поисковые ИИ.
Бонус-наблюдение: сканеры в масках
Отдельная категория поддельных «ИИ-ботов» занималась не контентом: за три дня зафиксировано 57 запросов к служебным путям вида /.git, /.ssh, /.env, /secrets.json, /actuator – под именами «Claude», «Bytespider», «Perplexity» и даже «Googlebot». Это автоматический перебор типовых мест, где разработчики иногда забывают закрыть доступ к служебным файлам. Сайт ответил на все запросы отказом (404/403) – но сам факт показателен: маска ИИ-бота стала стандартным камуфляжем для сканеров уязвимостей, ведь «модного» бота блокируют реже.
Как проверить ботов на своём сайте
Методика воспроизводится за вечер, нужны только access-логи:
- Выгрузите логи за несколько дней из панели хостинга (часто хранятся всего 3–7 дней – не откладывайте).
- Соберите статистику по User-Agent: сколько запросов у каждого бота, с каких IP.
- Сверьте IP с официальными списками – они публикуются в открытом виде (таблица со ссылками ниже).
- Для остальных – обратный DNS: команда
host <IP>должна вернуть домен владельца бота (например,spider.yandex.com), а прямая проверка этого домена – тот же IP. - Ищите «мультиличности»: сгруппируйте запросы по IP и посмотрите, сколько разных User-Agent приходит с одного адреса. Больше двух-трёх – почти наверняка сканер.
Официальные списки IP-адресов ботов
| Компания | Бот | Официальный список IP |
|---|---|---|
| OpenAI | GPTBot | openai.com/gptbot.json |
| ChatGPT-User | openai.com/chatgpt-user.json | |
| OAI-SearchBot | openai.com/searchbot.json | |
| Googlebot | developers.google.com/…/googlebot.json | |
| служебные краулеры | …/special-crawlers.json | |
| фетчеры по запросу | …/user-triggered-fetchers.json | |
| Microsoft | Bingbot | bing.com/toolbox/bingbot.json |
| Perplexity | PerplexityBot | perplexity.ai/perplexitybot.json |
| Perplexity-User | perplexity.ai/perplexity-user.json | |
| Anthropic | ClaudeBot | официального списка нет – только проверка через обратный DNS |
| Яндекс | YandexBot | списка нет – обратный DNS должен вести на spider.yandex.com |
Что делать с результатами – зависит от целей: настоящих ИИ-ботов, которые приводят людей (ChatGPT-User, OAI-SearchBot), стоит беречь и кормить структурированным контентом; подтверждённых самозванцев – ограничивать по IP-диапазонам, а не по User-Agent, который они сменят за минуту.
Выводы
- Боты – 39% трафика обычного B2B-сайта, и это норма 2026 года.
- User-Agent без проверки IP не значит ничего: 70% «Googlebot» и почти 100% «Bytespider» на исследованном сайте – подделки.
- Реальный ИИ-трафик скромнее сырых цифр, но он существенный и растёт: 237 подтверждённых визитов ChatGPT-User за 3 дня – это живые люди, которых не видит веб-аналитика.
- ИИ-ассистенты используют B2B-сайт как товарный справочник: 75% их интереса – каталог, а не статьи. Инвестируйте в карточки товаров.
- Маска ИИ-бота – новый камуфляж сканеров уязвимостей. Проверяйте, чем сервер отвечает на запросы к служебным путям.
Это первый срез наблюдений. Через месяц планирую повторить замер на том же сайте и посмотреть динамику: растёт ли доля ChatGPT-User и меняется ли поведение самозванцев. Если хотите такой же разбор для своего сайта – начните с бесплатной AI-диагностики или напишите мне.