Сайт становится видимым для ChatGPT и Perplexity, когда боты этих систем не заблокированы в robots.txt, могут прочитать контент без выполнения JavaScript, и сама страница даёт прямой ответ на вопрос в первых предложениях, а не в середине текста. Это три разных условия, и большинство сайтов проваливают хотя бы одно из них, даже не подозревая об этом. Дальше разберём, что реально управляет видимостью, а что является модной, но не влияющей на результат надстройкой.
По данным исследования SE Ranking на выборке почти 300 000 доменов, файл llms.txt установлен только на 10,13% сайтов, и корреляции между его наличием и частотой цитирования в ответах ИИ исследователи не нашли вообще - модель предсказывала цитируемость точнее, если убрать этот параметр из расчёта. Ещё раньше, в июле 2025 года, представитель Google Гэри Иллис подтвердил, что Google не использует и не планирует использовать llms.txt ни для обычного поиска, ни для AI Overviews.
Это не значит, что видимость для ИИ-систем не поддаётся управлению - значит только то, что модный файл, о котором чаще всего спрашивают, не тот рычаг, который реально работает. Дальше - что действительно управляет доступом ботов, чем принципиально отличается crawl для обучения модели от краулинга ради живого ответа, и как выстроить контент так, чтобы его было из чего цитировать.
Для бизнеса это ощутимая потеря: клиенты всё чаще формулируют исследовательский вопрос сразу в ChatGPT или Perplexity вместо строки поиска Google, и если сайт компании не попадает в такой ответ, конкурент, который настроил доступ и структуру контента правильно, получает упоминание вместо неё - без единого клика по рекламе.
Что именно означает “видимость” для ChatGPT и Perplexity
“Видимость” распадается на два независимых события: бот когда-то прочитал вашу страницу и может использовать её как источник данных, и бот процитировал вашу страницу прямо сейчас, отвечая на конкретный запрос пользователя. Это разные боты, разные цели и разные последствия блокировки.
У OpenAI разделение прямое: GPTBot собирает данные, которые потенциально попадут в обучение будущих моделей, а OAI-SearchBot индексирует страницы для живых ответов ChatGPT Search - и, по данным официального обзора краулеров OpenAI, эта индексация не используется для тренировки моделей. У Anthropic то же самое устроено ещё детальнее: ClaudeBot собирает обучающие данные, Claude-SearchBot индексирует контент для поиска Claude, а Claude-User обращается к странице в момент, когда конкретный пользователь Claude задаёт вопрос о ней. PerplexityBot у Perplexity вообще не участвует в обучении моделей - по официальной документации Perplexity, это краулер только для поиска и обработки пользовательских запросов.
Практическое следствие: сайт может разрешить PerplexityBot и OAI-SearchBot, чтобы попадать в живые ответы, и одновременно заблокировать GPTBot и ClaudeBot, если компания не хочет, чтобы её тексты использовались как обучающий материал для будущих версий моделей. Это не противоречие, а осознанный выбор, доступный через отдельные строки в robots.txt.
Robots.txt - там, где реально решается доступ
robots.txt: текстовый файл в корне сайта (example.com/robots.txt), который через директивы User-agent, Allow и Disallow сообщает краулерам, какие разделы сайта можно посещать. Это единственный из двух файлов в этой статье, который боты действительно проверяют перед каждым визитом и в подавляющем большинстве случаев соблюдают.
В отличие от llms.txt, robots.txt - старый и де-факто исполняемый стандарт: OpenAI, Anthropic и Perplexity в своей документации прямо подтверждают, что их краулеры уважают Disallow-директивы. Соблюдение остаётся добровольным - никакой технической блокировки за нарушение нет, - но у крупных легальных игроков есть репутационный и юридический стимул его придерживаться.
Пример конфигурации, которая разрешает живые ответы и закрывает обучающих ботов:
Пример robots.txt для разделения обучения и живых ответов
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
Список актуальных ботов стоит сверять по официальному обзору краулеров OpenAI и аналогичной документации Anthropic и Perplexity, а не по статьям вроде этой - список меняется, и то, что верно сегодня, через полгода может дополниться новым именем бота или новой политикой по умолчанию.
Отдельная техническая деталь для headless-сайтов и SPA: если контент рендерится через JavaScript, а бот его не выполняет (большинство ИИ-краулеров этого не делает - они читают отданный сервером HTML напрямую), правильный robots.txt не поможет, если страница до рендера отдаёт пустой <div id="root">. Это та же архитектурная проблема, которую мы разбирали в статье о том, почему сайт на React теряет позиции в Google - логика применима и к ИИ-краулерам, только последствие не падение в выдаче, а полное отсутствие контента для цитирования.
Файл llms.txt - что это, и чего он не гарантирует
llms.txt: предложенный в 2024 году markdown-файл в корне сайта (example.com/llms.txt), который в сжатом виде перечисляет разделы и ссылки сайта, чтобы упростить их чтение языковой моделью. Это не официальный веб-стандарт, а добровольная конвенция сообщества - её поддержка любой конкретной ИИ-системой не гарантирована.
По состоянию на 2026 год картина неоднозначная. С одной стороны, обсуждение формализации идёт: рабочая группа IETF по AI-краулерам начала черновик реестра user-agent, а инициатива W3C рассматривала предложение по стандартизации формата. С другой стороны, ни один крупный поставщик модели, включая OpenAI, Anthropic и Google, не подтвердил публично, что использует llms.txt как сигнал в продакшене. Google - самый прямой пример: Гэри Иллис объяснил позицию тем, что отдельный файл с пересказом контента невозможно проверить на соответствие живой странице, и сравнил идею с мета-тегом keywords, от которого Google отказался десятилетия назад именно из-за того, что это был самодекларируемый и легко подделываемый сигнал.
Это не значит, что заводить llms.txt бессмысленно - файл ничего не стоит с точки зрения производительности и не может навредить. Но относиться к нему стоит как к необязательной визитке, а не как к инструменту, который управляет видимостью: реальный рычаг - robots.txt для доступа и структура контента для цитируемости, разобранные в этой статье отдельно.
Почему стоит разделять crawl для обучения и краулинг для ответа
Разница между “бот собрал ваш текст в обучающую выборку” и “бот процитировал вашу страницу в ответе на вопрос пользователя прямо сейчас” - это разница между двумя независимыми бизнес-эффектами, и путать их значит принимать решения о блокировке вслепую.
Обучающий краулинг влияет на то, как будущие версии модели будут описывать ваш продукт или отрасль в целом - эффект отложенный, размытый по миллионам источников и не поддающийся измерению на уровне одного сайта. Краулинг для живого ответа (retrieval) - конкретный и измеримый эффект: если PerplexityBot или OAI-SearchBot смогли прочитать страницу, есть реальный шанс получить упоминание с прямой ссылкой в ответе пользователю, который через минуту может зайти на сайт.
Поэтому у части компаний логика простая: блокировать GPTBot, Google-Extended и CCBot, потому что обучающие данные не приносят измеримой пользы бизнесу, и одновременно держать открытыми OAI-SearchBot, PerplexityBot и Claude-SearchBot, потому что именно они формируют прямой канал привлечения посетителей. Это не универсальный совет - для контентных издателей, зарабатывающих на трафике, логика может быть обратной, - но сама развилка должна быть осознанным решением, а не побочным эффектом того, что кто-то скопировал чужой robots.txt без разбора.
Структура текста, которую AI-системы реально цитируют
Даже с полностью открытым доступом ботов шанс на цитирование зависит от того, как устроен сам текст - ИИ-системы не пересказывают статью целиком, они извлекают конкретный фрагмент, который отвечает на заданный вопрос.
AEO/GEO: Answer Engine Optimization и Generative Engine Optimization - практики построения контента так, чтобы фрагменты страницы можно было извлечь и процитировать в ответе ИИ-системы без потери смысла. Термины часто используют как синонимы, хотя GEO иногда трактуют шире - как работу с общей цитируемостью бренда, а не только с конкретными ответами.
Что реально влияет на извлекаемость фрагмента:
- Прямой ответ на вопрос заголовка в первом же предложении раздела, а не после трёх абзацев подводки
- Явные заголовки H2/H3, сформулированные как конкретный вопрос или конкретное утверждение, а не общими словами вроде “Дополнительная информация”
- Короткие абзацы на 2-4 предложения - длинные блоки текста модели обрезают при цитировании, теряя часть смысла
- Структурированные данные в формате JSON-LD - Article, FAQPage, HowTo, - которые дают модели явную, машиночитаемую разметку вместо необходимости угадывать структуру по вёрстке
Подробно про то, как внедрить эту разметку на headless-сайте, включая примеры кода для разных типов страниц, мы разбирали в статье о структурированных данных на headless-сайте. Это тот случай, когда одна и та же работа одновременно улучшает обычную SEO-выдачу и цитируемость в ИИ-ответах - усилия не дублируются.
Как это выглядит на практике
В типовом проекте аудита маркетингового сайта B2B-компании (20-40 сотрудников) картина обычно похожая: robots.txt либо вообще не упоминает ИИ-ботов, либо скопирован из шаблона трёхлетней давности и блокирует всех подряд, включая PerplexityBot и OAI-SearchBot, потому что автор шаблона в 2023 году добавил их “на всякий случай” вместе с обучающими краулерами.
После разбора по ботам обычно закрывают только GPTBot, ClaudeBot, Google-Extended и CCBot, оставляя открытыми поисковые и retrieval-краулеры. Отдельно проверяют, не рендерится ли основной контент исключительно через клиентский JavaScript - если сайт построен на устаревшей SPA-архитектуре, боты просто не видят текст, сколько бы правил ни было прописано в robots.txt. Для сайтов на статической генерации или серверном рендеринге (Astro, Next.js с SSR) эта проблема не возникает в принципе - у HTML, который получает браузер, и HTML, который видит бот, нет разницы.
Компании, недавно переехавшие с WordPress на современный стек, часто получают эту видимость “бесплатно” просто за счёт архитектуры - подробно про сам процесс переезда и что при этом сохраняется мы писали в статье о переносе сайта с WordPress на Astro. Отдельная правка контента под прямые ответы и заголовки-вопросы обычно даёт заметный эффект за 4-6 недель - именно столько в среднем занимает переиндексация основных страниц у большинства ИИ-краулеров.
Для кого это особенно актуально
Внимания к видимости для ИИ-систем требует в первую очередь бизнес, у которого целевая аудитория - технически подкованные покупатели, всё чаще формулирующие исследовательский запрос прямо в ChatGPT или Perplexity вместо строки поиска: SaaS-продукты, консалтинг, B2B-услуги со сложным циклом продажи. Для локального бизнеса или e-commerce с транзакционным трафиком эффект от настройки будет заметно меньше - там основной канал остаётся классический поиск и реклама.
Это также особенно актуально для компаний, у которых сайт технически устарел - на WordPress с тяжёлыми плагинами, на конструкторе без контроля над рендерингом или вообще без структурированных данных. В таких случаях правки robots.txt недостаточно: сначала нужно убедиться, что боты физически могут прочитать контент. На уже работающем сайте настройка robots.txt и llms.txt обычно выполняется как локальная техническая доработка, не требующая переделки остального кода.
Часто задаваемые вопросы
Нужно ли добавлять llms.txt на сайт в 2026 году?
Файл не навредит, но и не гарантирует появления в ответах ИИ-систем. По данным исследования SE Ranking на выборке почти 300 000 доменов, корреляции между наличием llms.txt и частотой цитирования не обнаружено, а Google прямо подтвердил, что не использует файл ни в каком виде. Приоритет стоит отдавать правильному robots.txt и структуре контента - это реально управляет видимостью.
Как проверить, заблокирован ли мой сайт для GPTBot или PerplexityBot?
Откройте ваш-домен.ru/robots.txt в браузере и найдите блоки User-agent: GPTBot, User-agent: PerplexityBot, User-agent: ClaudeBot и другие. Если рядом с нужным ботом стоит Disallow: /, доступ закрыт полностью. Отсутствие упоминания бота в файле по умолчанию означает разрешённый доступ - явно запрещать нужно только то, что вы хотите заблокировать.
Блокировка GPTBot повредит позициям сайта в обычном поиске Google?
Нет, это независимые системы. GPTBot относится к OpenAI и не связан с Googlebot, который сканирует сайт для обычной поисковой выдачи Google. Блокировка одного краулера не влияет на индексацию другим - каждая директива в robots.txt относится только к указанному в ней User-agent.
Можно ли заблокировать всех ИИ-ботов сразу одной директивой?
Да, но результат будет грубым: правило User-agent: * с Disallow: / закроет доступ вообще всем краулерам, включая Googlebot и Bingbot, от которых зависит обычная поисковая видимость сайта. Для точечной блокировки только ИИ-краулеров нужно прописывать каждого бота отдельной строкой User-agent, как показано в примере выше.
Как часто нужно пересматривать список разрешённых и заблокированных ботов?
Список стоит сверять минимум раз в квартал: новые боты появляются, у существующих меняется область ответственности - например, в феврале 2026 года Anthropic обновила документацию и разделила ClaudeBot на три отдельных бота с разной логикой блокировки. Единого устоявшегося стандарта в этой области пока нет, и то, что верно сегодня, не гарантированно останется верным через полгода.
Итог
Видимость сайта для ChatGPT и Perplexity управляется тремя рычагами, и все три проверяемы за один день:
- Robots.txt с явными правилами по каждому боту - основной и единственный реально исполняемый механизм доступа
- Техническая доступность контента без выполнения JavaScript - без неё правильный robots.txt не поможет
- Структура текста с прямыми ответами, понятными заголовками и структурированными данными - то, что определяет, процитируют ли фрагмент страницы
llms.txt в этот список не входит - это необязательное дополнение без подтверждённого эффекта на цитируемость.
Если не уверены, что ваш сайт технически виден для ИИ-краулеров, или контент до сих пор рендерится так, что боты видят пустую страницу, опишите ситуацию команде Exceltic.dev. Проверим robots.txt, доступность рендеринга и структуру контента и покажем, что конкретно мешает попаданию сайта в ответы ChatGPT и Perplexity. Это часть разработки и оптимизации сайтов, которой занимается Exceltic.dev.