llms.txt на четырёх сайтах: 152 обращения к файлу и ни одного от ботов ИИ-компаний
Исследование11 мин 10 Обновлено 24 сентября
TL;DR
- На четырёх сайтах с установленным llms.txt набралось 152 обращения к файлу. Подтверждённых запросов от ботов OpenAI, Perplexity и Anthropic среди них ноль.
- По страницам тех же сайтов боты с именами ИИ-сервисов сделали около сорока пяти тысяч запросов. Содержимое они берут обычным обходом страниц.
- Имя бота в логах подделывается кем угодно: на моём сайте из 9 259 таких запросов подтвердились 2 175, подделками оказались 2 637, а 4 447 проверить нечем.
- Файл дёшев и вреда не несёт, снимать его незачем. Но ожиданий по видимости в ИИ-поиске на него вешать не стоит.
Замер сделан 24 сентября 2026 года по логам четырёх сайтов: моего и трёх клиентских, на всех стоит llms.txt. Все цифры из собственных логов, адреса ботов сверены с официальными списками OpenAI, Perplexity и Anthropic. Как именно считала – в разделе про методику. Главное ограничение назову сразу: глубина логов у сайтов разная, от 11 суток до 67, поэтому сайты сравнимы по смыслу, но не по абсолютным числам.
Что я проверяла
В апреле 2026 года я написала гайд о том, как поставить llms.txt на "1С-Битрикс", и поставила файл себе. Потом поставила его клиентам.
Гайд читают: на 24 сентября 2026 года по запросу о создании llms.txt для Битрикса Алиса ставит его первым источником своего быстрого ответа, а в обычной выдаче Яндекса он идёт первым живым результатом. Perplexity в тот же день этот материал не процитировал ни разу: в его дюжине источников моего сайта нет. Весной цитировал, сейчас нет, и это само по себе показательно.
Получается смешное. Инструкцию про llms.txt ИИ-системы читают и цитируют охотно. А вот читают ли они сам файл, за которым, по замыслу стандарта, и должны приходить?
Проверить это можно только одним способом: открыть логи и посмотреть, кто запрашивал файл. Что я и сделала на четырёх сайтах сразу.
Как я считала
Источник данных – журналы обращений к серверу. В них видно каждый запрос: адрес, с которого пришли, что запросили, что получили в ответ и чем представился клиент.
К ИИ-ботам я относила запросы, где клиент представился одним из известных имён: GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User, anthropic-ai, Google-Extended, Bytespider, CCBot, YandexAdditional, Applebot-Extended, meta-externalagent. Обычные поисковые роботы в счёт не входят.
Запросы к файлу отбирались по точному адресу, а не по вхождению строки: иначе в выборку попадут посторонние адреса вроде резервной копии файла. Вот команда, если хотите повторить у себя. Она разбирает и сжатые архивы логов, и текущий файл.
zcat -f /var/www/httpd-logs/site.ru.access.log* | grep -aE '"(GET|HEAD) /llms\.txt[ ?]'
И сразу важное: одного имени бота недостаточно. Представиться GPTBot или PerplexityBot может кто угодно, это обычная строка в запросе. Поэтому на моём сайте сборщик дополнительно сверяет адрес, с которого пришёл запрос, с официальными списками адресов OpenAI, Perplexity и Anthropic. В колонку "настоящие ИИ" попадает только то, что эту сверку прошло.
Результат по четырём сайтам
Сначала таблица, потом объяснение.
| Сфера | Период | Запросов ботов | К llms.txt | Подтверждённых |
|---|---|---|---|---|
| Медицина | 67 суток | около 27 960 | 51 | 0 |
| Мой сайт | 64 суток | 9 259 | 48 | 0 |
| Строительство 1 | 11 суток | около 7 580 | 26 | 0 |
| Строительство 2 | 11 суток | около 550 | 27 | 0 |
Важное про последнюю колонку. Подтвердить бота можно только у тех компаний, которые публикуют списки своих адресов: это OpenAI, Perplexity и Anthropic. Запросы Bytespider, CCBot, Google-Extended, meta-externalagent и прочих в эту колонку попасть не могут в принципе, сверять их не с чем.
По моему сайту цифра 9 259 – это счёт по именам ботов. Сверка по адресам подтвердила 2 175, опознала 2 637 как подделки, а оставшиеся 4 447 проверить нечем. На клиентских сайтах такой сверки не было, поэтому там числа приблизительные.
Итого: 152 обращения к файлу llms.txt и ни одного подтверждённого запроса от ботов OpenAI, Perplexity или Anthropic. При этом по страницам тех же самых сайтов боты с именами ИИ-сервисов сделали около сорока пяти тысяч запросов.
Второй столбик на графике не виден не потому, что его забыли нарисовать. Он есть, просто в этом масштабе его не разглядеть. Это и есть результат замера.
Единственное обращение к файлу, отдалённо связанное с ИИ, за все два месяца – один запрос CCBot на сайте медицинского центра. Это краулер Common Crawl, который собирает общий архив веба, и на его корпусе потом учат модели. Был ли это настоящий Common Crawl, проверить нечем: публичного списка адресов у него нет.
Кто же тогда ходил за файлом? Сервисы SEO-аналитики, мелкие сканеры и браузеры. На моём сайте: браузеры 14 раз, сервис SEOJuice 10, ручные проверки через curl 10, дальше по одному-два раза yacybot, PoweredByBot, SeoScannerBot, DropMonBot. На клиентских сайтах картина та же, плюс PR-CY, Dataprovider и TheWebReport.
Что боты запрашивают вместо файла
Если llms.txt они не берут, то что берут? Обычные страницы, и в огромных количествах.
Обычные страницы: разделы каталога, карточки услуг, статьи, контакты. То же самое, что обходят поисковые роботы.
На сайте медицинского центра за два месяца: Bytespider почти 13 700 запросов, PerplexityBot около 8 600, ChatGPT-User 1 689, OAI-SearchBot 1 143, ClaudeBot 994. На первом строительном сайте за одиннадцать дней лидирует meta-externalagent с 1 866 запросами, следом GPTBot с 1 685.
Подробный разбор, какие именно адреса берут разные боты, с какой частотой и сколько среди них подделок, я делала отдельно – в разборе логов за 2026 год.
То есть механизм, которым ИИ-системы узнают содержимое сайта, работает и без всякого llms.txt. Они обходят страницы так же, как это делают поисковые роботы, и опираются на то же самое: карту сайта, внутренние ссылки, заголовки, разметку.
Отдельно отмечу: YandexAdditional не встретился ни разу ни на одном из четырёх сайтов. Это тот робот, который отвечает за попадание страниц в ответы Алисы, Нейро и YandexGPT. Ни одного запроса за весь период наблюдения ни к файлу, ни к страницам.
Что это значит на практике
Сразу оговорюсь, чего этот замер не доказывает. Он не доказывает, что llms.txt бесполезен в принципе и что его нужно снимать. Он показывает узкую вещь: на четырёх конкретных сайтах за период наблюдения ИИ-ассистенты этот файл не запрашивали.
Отсюда три практических вывода.
- Не рассчитывайте, что установка llms.txt сама по себе что-то изменит в видимости сайта у ИИ. Файл стоит десять минут работы, но ожиданий на него вешать не стоит.
- Вкладывайтесь в то, что боты действительно запрашивают: доступность страниц, карта сайта, честные заголовки, внятная разметка, отсутствие мусорных адресов и ошибок.
- Если решите проверить свой сайт, не верьте сводке по именам ботов. Смотрите сырые строки лога и сверяйте адреса с официальными списками.
Снимать файл я не буду ни у себя, ни у клиентов. Стоит он дёшево, вреда не несёт, а стандарт может ещё и заработать. Но и переставать мерить не собираюсь: сборщик считает ежедневно, и если картина изменится, это будет видно.
Ограничения замера
- Разная глубина логов. У моего сайта и у медицинского данные за два месяца, у двух строительных всего за одиннадцать дней. Одиннадцать суток это мало, и отсутствие обращений там менее показательно.
- Четыре сайта это не выборка. Это четыре сайта. Обобщать на весь интернет нельзя.
- Проверка по адресам возможна не для всех. Публичные списки есть у OpenAI, Perplexity и Anthropic. Для Bytespider, CCBot, Google-Extended и других такой сверки в моём сборщике нет, их числа остаются приблизительными.
- Тематика сайтов узкая: медицина, строительство, веб-разработка. На других тематиках поведение ботов может отличаться.
- Файл везде поставлен недавно. На клиентских сайтах в середине сентября. Возможно, боты просто ещё не дошли.
// Вывод у замера скучный и от этого честный: файл лежит, боты ходят мимо. Я не снимаю llms.txt ни у себя, ни у клиентов и продолжаю считать обращения каждый день. Если картина изменится, я об этом напишу – с цифрами, а не с ожиданиями.
Частые вопросы
Читают ли ИИ-боты llms.txt?
По логам четырёх сайтов за период наблюдения – нет. 152 обращения к файлу, и ни одно из них не подтверждается как запрос бота OpenAI, Perplexity или Anthropic. Единственное близкое – один запрос CCBot, краулера Common Crawl; проверить, настоящий ли он, нечем, публичного списка адресов у Common Crawl нет. Это наблюдение на четырёх сайтах, а не утверждение обо всём интернете.
Может, файл настроен неправильно и поэтому его не берут?
Нет. На всех четырёх сайтах файл отдаётся с кодом 200, лежит по стандартному адресу в корне, в UTF-8, ссылки внутри канонические. Размеры от 3,6 до 13 килобайт. Сервисы SEO-аналитики и браузеры его спокойно забирают, значит он доступен. За ним просто не приходят ИИ-боты.
Тогда зачем вообще ставить llms.txt?
Установка занимает минут десять и вреда не несёт, а стандарт может ещё заработать. Я не снимаю файл ни у себя, ни у клиентов. Но вешать на него ожидания по видимости в ИИ-поиске оснований нет: боты приходят за страницами, а не за ним.
Почему нельзя просто посчитать по имени бота в логах?
Потому что имя бота – это обычная строка в запросе, её подставляет кто угодно. На моём сайте за два месяца из 9 259 запросов, где стояли имена ИИ-ботов, сверка по адресам подтвердила только 2 175, а 2 637 прямо опознала как подделки. Встречаются и сканеры уязвимостей под именем ChatGPT-User, и проверочные инструменты, которые перебирают имена ботов подряд с одного адреса. Поэтому считать надо не по именам, а по адресам.
Как проверить адрес бота самостоятельно?
У OpenAI, Perplexity и Anthropic есть открытые списки адресов, с которых ходят их роботы. Берёте адрес из строки лога и проверяете вхождение в эти списки. Если адреса там нет, а имя бота стоит – перед вами подделка. Для части ботов, например Bytespider или CCBot, публичных списков нет, их числа останутся приблизительными.
Что тогда действительно влияет на видимость сайта в ИИ-поиске?
То же, что и на обычную видимость: доступность страниц, живая карта сайта, честные заголовки и описания, разметка, отсутствие мусорных адресов и ошибок. Боты обходят страницы так же, как поисковые роботы, и опираются на то же самое. В этом замере они сделали около сорока пяти тысяч запросов именно по страницам.
Материалы по теме
Что почитать дальше по этой теме