Термин

AI-краулер (бот нейросети)

Программа-робот, которая обходит сайты не для классического поискового индекса, а чтобы собрать текст для обучения нейросети или для ответа в реальном времени. У каждого крупного ИИ-сервиса — свой краулер с собственным именем.

Что это

AI-краулер работает похоже на обычного поискового робота — заходит на страницы и читает их, — но с другой целью: не построить список ссылок для выдачи, а собрать материал для обучения модели или для ответа на конкретный запрос пользователя в моменте.

Какие бывают

У большинства ИИ-провайдеров по два типа бота. Обучающий: GPTBot у OpenAI, Google-Extended у Google, ClaudeBot у Anthropic — они собирают материал, на котором дообучают будущие версии модели. И поисковый: OAI-SearchBot и ChatGPT-User у OpenAI, PerplexityBot у Perplexity — эти заходят на страницу в момент, когда реальный пользователь задал вопрос, и им нужен свежий ответ прямо сейчас.

Как ими управлять

Каждый бот представляется под своим именем в user-agent, и robots.txt может разрешать или запрещать их по отдельности. Например, можно закрыть обучающего бота (чтобы материал не шёл в тренировочные данные будущей модели), но оставить открытым поискового (чтобы сайт всё равно попадал в ответы ИИ-поиска здесь и сейчас) — это два разных решения, а не одно.

Честная оговорка: не все боты соблюдают правила. Часть краулеров, включая некоторые агрессивные сборщики контента, документированно игнорировали robots.txt — тогда единственная защита технического уровня, а не договорённости.

Почему это важно вам

Прежде чем настраивать llms.txt или разметку, стоит убедиться, что нужные боты вообще пускают на сайт — иначе всё остальное не имеет смысла: закрытый для краулера сайт не попадёт в ИИ-ответы точно так же, как закрытый robots.txt не даёт индексироваться в обычном поиске.