Что это
AI-краулер работает похоже на обычного поискового робота — заходит на страницы и читает их, — но с другой целью: не построить список ссылок для выдачи, а собрать материал для обучения модели или для ответа на конкретный запрос пользователя в моменте.
Какие бывают
У большинства ИИ-провайдеров по два типа бота. Обучающий: GPTBot у OpenAI, Google-Extended у Google, ClaudeBot у Anthropic — они собирают материал, на котором дообучают будущие версии модели. И поисковый: OAI-SearchBot и ChatGPT-User у OpenAI, PerplexityBot у Perplexity — эти заходят на страницу в момент, когда реальный пользователь задал вопрос, и им нужен свежий ответ прямо сейчас.
Как ими управлять
Каждый бот представляется под своим именем в user-agent, и robots.txt может разрешать или запрещать их по отдельности. Например, можно закрыть обучающего бота (чтобы материал не шёл в тренировочные данные будущей модели), но оставить открытым поискового (чтобы сайт всё равно попадал в ответы ИИ-поиска здесь и сейчас) — это два разных решения, а не одно.
Честная оговорка: не все боты соблюдают правила. Часть краулеров, включая некоторые агрессивные сборщики контента, документированно игнорировали robots.txt — тогда единственная защита технического уровня, а не договорённости.
Почему это важно вам
Прежде чем настраивать llms.txt или разметку, стоит убедиться, что нужные боты вообще пускают на сайт — иначе всё остальное не имеет смысла: закрытый для краулера сайт не попадёт в ИИ-ответы точно так же, как закрытый robots.txt не даёт индексироваться в обычном поиске.