llms.txt на четырёх сайтах: 152 обращения к файлу и ни одного от ботов ИИ-компаний

Исследование
Файл llms.txt стоит на четырёх сайтах, за которыми я слежу. Открыла логи всех четырёх: 152 обращения к файлу и ни одного подтверждённого от ботов OpenAI, Perplexity или Anthropic. Разбираю, кто всё-таки ходит за файлом и почему считать по именам нельзя.

11 мин 10 Обновлено 24 сентября

TL;DR

  • На четырёх сайтах с установленным llms.txt набралось 152 обращения к файлу. Подтверждённых запросов от ботов OpenAI, Perplexity и Anthropic среди них ноль.
  • По страницам тех же сайтов боты с именами ИИ-сервисов сделали около сорока пяти тысяч запросов. Содержимое они берут обычным обходом страниц.
  • Имя бота в логах подделывается кем угодно: на моём сайте из 9 259 таких запросов подтвердились 2 175, подделками оказались 2 637, а 4 447 проверить нечем.
  • Файл дёшев и вреда не несёт, снимать его незачем. Но ожиданий по видимости в ИИ-поиске на него вешать не стоит.

Замер сделан 24 сентября 2026 года по логам четырёх сайтов: моего и трёх клиентских, на всех стоит llms.txt. Все цифры из собственных логов, адреса ботов сверены с официальными списками OpenAI, Perplexity и Anthropic. Как именно считала – в разделе про методику. Главное ограничение назову сразу: глубина логов у сайтов разная, от 11 суток до 67, поэтому сайты сравнимы по смыслу, но не по абсолютным числам.

Что я проверяла

В апреле 2026 года я написала гайд о том, как поставить llms.txt на "1С-Битрикс", и поставила файл себе. Потом поставила его клиентам.

Гайд читают: на 24 сентября 2026 года по запросу о создании llms.txt для Битрикса Алиса ставит его первым источником своего быстрого ответа, а в обычной выдаче Яндекса он идёт первым живым результатом. Perplexity в тот же день этот материал не процитировал ни разу: в его дюжине источников моего сайта нет. Весной цитировал, сейчас нет, и это само по себе показательно.

Получается смешное. Инструкцию про llms.txt ИИ-системы читают и цитируют охотно. А вот читают ли они сам файл, за которым, по замыслу стандарта, и должны приходить?

Проверить это можно только одним способом: открыть логи и посмотреть, кто запрашивал файл. Что я и сделала на четырёх сайтах сразу.

Как я считала

Источник данных – журналы обращений к серверу. В них видно каждый запрос: адрес, с которого пришли, что запросили, что получили в ответ и чем представился клиент.

К ИИ-ботам я относила запросы, где клиент представился одним из известных имён: GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User, anthropic-ai, Google-Extended, Bytespider, CCBot, YandexAdditional, Applebot-Extended, meta-externalagent. Обычные поисковые роботы в счёт не входят.

Запросы к файлу отбирались по точному адресу, а не по вхождению строки: иначе в выборку попадут посторонние адреса вроде резервной копии файла. Вот команда, если хотите повторить у себя. Она разбирает и сжатые архивы логов, и текущий файл.

zcat -f /var/www/httpd-logs/site.ru.access.log* | grep -aE '"(GET|HEAD) /llms\.txt[ ?]'

И сразу важное: одного имени бота недостаточно. Представиться GPTBot или PerplexityBot может кто угодно, это обычная строка в запросе. Поэтому на моём сайте сборщик дополнительно сверяет адрес, с которого пришёл запрос, с официальными списками адресов OpenAI, Perplexity и Anthropic. В колонку "настоящие ИИ" попадает только то, что эту сверку прошло.

Результат по четырём сайтам

Сначала таблица, потом объяснение.

СфераПериодЗапросов ботовК llms.txtПодтверждённых
Медицина67 сутококоло 27 960510
Мой сайт64 суток9 259480
Строительство 111 сутококоло 7 580260
Строительство 211 сутококоло 550270

Важное про последнюю колонку. Подтвердить бота можно только у тех компаний, которые публикуют списки своих адресов: это OpenAI, Perplexity и Anthropic. Запросы Bytespider, CCBot, Google-Extended, meta-externalagent и прочих в эту колонку попасть не могут в принципе, сверять их не с чем.

По моему сайту цифра 9 259 – это счёт по именам ботов. Сверка по адресам подтвердила 2 175, опознала 2 637 как подделки, а оставшиеся 4 447 проверить нечем. На клиентских сайтах такой сверки не было, поэтому там числа приблизительные.

Итого: 152 обращения к файлу llms.txt и ни одного подтверждённого запроса от ботов OpenAI, Perplexity или Anthropic. При этом по страницам тех же самых сайтов боты с именами ИИ-сервисов сделали около сорока пяти тысяч запросов.

Боты ходят по сайту пачками, а в сам файл не заглядывают
Запросов по сайтуЗапросов к llms.txtМедицина27 96251Мой сайт9 25948Строительство 17 57626Строительство 254627

Второй столбик на графике не виден не потому, что его забыли нарисовать. Он есть, просто в этом масштабе его не разглядеть. Это и есть результат замера.

Единственное обращение к файлу, отдалённо связанное с ИИ, за все два месяца – один запрос CCBot на сайте медицинского центра. Это краулер Common Crawl, который собирает общий архив веба, и на его корпусе потом учат модели. Был ли это настоящий Common Crawl, проверить нечем: публичного списка адресов у него нет.

Кто же тогда ходил за файлом? Сервисы SEO-аналитики, мелкие сканеры и браузеры. На моём сайте: браузеры 14 раз, сервис SEOJuice 10, ручные проверки через curl 10, дальше по одному-два раза yacybot, PoweredByBot, SeoScannerBot, DropMonBot. На клиентских сайтах картина та же, плюс PR-CY, Dataprovider и TheWebReport.

Что боты запрашивают вместо файла

Если llms.txt они не берут, то что берут? Обычные страницы, и в огромных количествах.

Обычные страницы: разделы каталога, карточки услуг, статьи, контакты. То же самое, что обходят поисковые роботы.

На сайте медицинского центра за два месяца: Bytespider почти 13 700 запросов, PerplexityBot около 8 600, ChatGPT-User 1 689, OAI-SearchBot 1 143, ClaudeBot 994. На первом строительном сайте за одиннадцать дней лидирует meta-externalagent с 1 866 запросами, следом GPTBot с 1 685.

Подробный разбор, какие именно адреса берут разные боты, с какой частотой и сколько среди них подделок, я делала отдельно – в разборе логов за 2026 год.

То есть механизм, которым ИИ-системы узнают содержимое сайта, работает и без всякого llms.txt. Они обходят страницы так же, как это делают поисковые роботы, и опираются на то же самое: карту сайта, внутренние ссылки, заголовки, разметку.

Отдельно отмечу: YandexAdditional не встретился ни разу ни на одном из четырёх сайтов. Это тот робот, который отвечает за попадание страниц в ответы Алисы, Нейро и YandexGPT. Ни одного запроса за весь период наблюдения ни к файлу, ни к страницам.

Что это значит на практике

Сразу оговорюсь, чего этот замер не доказывает. Он не доказывает, что llms.txt бесполезен в принципе и что его нужно снимать. Он показывает узкую вещь: на четырёх конкретных сайтах за период наблюдения ИИ-ассистенты этот файл не запрашивали.

Отсюда три практических вывода.

  • Не рассчитывайте, что установка llms.txt сама по себе что-то изменит в видимости сайта у ИИ. Файл стоит десять минут работы, но ожиданий на него вешать не стоит.
  • Вкладывайтесь в то, что боты действительно запрашивают: доступность страниц, карта сайта, честные заголовки, внятная разметка, отсутствие мусорных адресов и ошибок.
  • Если решите проверить свой сайт, не верьте сводке по именам ботов. Смотрите сырые строки лога и сверяйте адреса с официальными списками.

Снимать файл я не буду ни у себя, ни у клиентов. Стоит он дёшево, вреда не несёт, а стандарт может ещё и заработать. Но и переставать мерить не собираюсь: сборщик считает ежедневно, и если картина изменится, это будет видно.

Ограничения замера

  • Разная глубина логов. У моего сайта и у медицинского данные за два месяца, у двух строительных всего за одиннадцать дней. Одиннадцать суток это мало, и отсутствие обращений там менее показательно.
  • Четыре сайта это не выборка. Это четыре сайта. Обобщать на весь интернет нельзя.
  • Проверка по адресам возможна не для всех. Публичные списки есть у OpenAI, Perplexity и Anthropic. Для Bytespider, CCBot, Google-Extended и других такой сверки в моём сборщике нет, их числа остаются приблизительными.
  • Тематика сайтов узкая: медицина, строительство, веб-разработка. На других тематиках поведение ботов может отличаться.
  • Файл везде поставлен недавно. На клиентских сайтах в середине сентября. Возможно, боты просто ещё не дошли.

// Вывод у замера скучный и от этого честный: файл лежит, боты ходят мимо. Я не снимаю llms.txt ни у себя, ни у клиентов и продолжаю считать обращения каждый день. Если картина изменится, я об этом напишу – с цифрами, а не с ожиданиями.

Частые вопросы

Читают ли ИИ-боты llms.txt?

По логам четырёх сайтов за период наблюдения – нет. 152 обращения к файлу, и ни одно из них не подтверждается как запрос бота OpenAI, Perplexity или Anthropic. Единственное близкое – один запрос CCBot, краулера Common Crawl; проверить, настоящий ли он, нечем, публичного списка адресов у Common Crawl нет. Это наблюдение на четырёх сайтах, а не утверждение обо всём интернете.

Может, файл настроен неправильно и поэтому его не берут?

Нет. На всех четырёх сайтах файл отдаётся с кодом 200, лежит по стандартному адресу в корне, в UTF-8, ссылки внутри канонические. Размеры от 3,6 до 13 килобайт. Сервисы SEO-аналитики и браузеры его спокойно забирают, значит он доступен. За ним просто не приходят ИИ-боты.

Тогда зачем вообще ставить llms.txt?

Установка занимает минут десять и вреда не несёт, а стандарт может ещё заработать. Я не снимаю файл ни у себя, ни у клиентов. Но вешать на него ожидания по видимости в ИИ-поиске оснований нет: боты приходят за страницами, а не за ним.

Почему нельзя просто посчитать по имени бота в логах?

Потому что имя бота – это обычная строка в запросе, её подставляет кто угодно. На моём сайте за два месяца из 9 259 запросов, где стояли имена ИИ-ботов, сверка по адресам подтвердила только 2 175, а 2 637 прямо опознала как подделки. Встречаются и сканеры уязвимостей под именем ChatGPT-User, и проверочные инструменты, которые перебирают имена ботов подряд с одного адреса. Поэтому считать надо не по именам, а по адресам.

Как проверить адрес бота самостоятельно?

У OpenAI, Perplexity и Anthropic есть открытые списки адресов, с которых ходят их роботы. Берёте адрес из строки лога и проверяете вхождение в эти списки. Если адреса там нет, а имя бота стоит – перед вами подделка. Для части ботов, например Bytespider или CCBot, публичных списков нет, их числа останутся приблизительными.

Что тогда действительно влияет на видимость сайта в ИИ-поиске?

То же, что и на обычную видимость: доступность страниц, живая карта сайта, честные заголовки и описания, разметка, отсутствие мусорных адресов и ошибок. Боты обходят страницы так же, как поисковые роботы, и опираются на то же самое. В этом замере они сделали около сорока пяти тысяч запросов именно по страницам.

10

Материалы по теме

Что почитать дальше по этой теме

Новость Google добавил llms.txt в свою документацию – и удалил за несколько часов. Что произошло и при чём тут AI-видимость 3 декабря 2025 года SEO-специалист Лидия Инфанте обнаружила файл llms.txt на портале Google Search Central – том самом, где Google месяцами называл этот стандарт бесполезным. Файл удалили в тот же день, но инцидент обнажил разрыв между публичной позицией Google и внутренними экспериментами. Разбираю хронологию, реакцию индустрии и практические выводы для владельцев сайтов. 7 мин 553 25 апреля 2026 Исследование Кто на самом деле сканирует ваш сайт в 2026: разбор логов реального интернет-магазина Выгрузила access-логи B2B-магазина за три дня и проверила каждого "ИИ-бота" по IP. Результат: 70% "Googlebot" – подделки, Bytespider – самозванец целиком, а ChatGPT за это время привёл на сайт 70+ живых людей. Полный разбор с таблицами, графиками и методикой проверки. 11 мин 403 21 июля 2026 Разбор ChatGPT уже отправляет вам клиентов – как увидеть это в логах 237 подтверждённых запросов ChatGPT-User за три дня на обычном B2B-сайте: 21 точечный вопрос и две глубокие сессии агентного ресёрча по каталогу. Разбираю тройку ботов OpenAI, показываю сессии на графике и объясняю, почему этот трафик не видит ни Метрика, ни GA4. 8 мин 320 21 июля 2026