Как разрешить или запретить ИИ-ботам сканировать ваш сайт
Ваш контент по умолчанию доступен ИИ-ботам, которые скачивают его для обучения моделей. Хотите вы этого или нет — решать вам, но сначала стоит понять, как вообще управлять доступом. Разберём по шагам: от простого robots.txt до блокировки на уровне сервера.
Шаг 0. Решите, чего вы хотите
Прежде чем что-то настраивать, определитесь. Возможны три позиции:
- Пустить всех — контент попадёт в обучение моделей, взамен вы ничего не получаете, но и не теряете трафик. Позиция по умолчанию.
- Запретить обучающим ботам — поисковики оставляем (они ведут людей на сайт), а тех, кто качает контент только для обучения, закрываем.
- Пустить за плату — новый вариант через посредников вроде Cloudflare, о котором ниже.
Ключевое различие — между поисковым роботом и обучающим. Первый приводит вам посетителей, второй просто забирает текст. Часто их хочется развести: поиск разрешить, обучение запретить.
Шаг 1. robots.txt — базовый уровень
robots.txt — файл в корне сайта (ваш-домен.ру/robots.txt), где вы указываете, какому боту что можно. Формат простой: имя бота и запрет или разрешение путей.
Чтобы запретить конкретному ИИ-краулеру весь сайт:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Здесь GPTBot, ClaudeBot и Google-Extended — обучающие боты OpenAI, Anthropic и Google. Важная тонкость: Google-Extended управляет только обучением, а обычный Googlebot (поиск) остаётся нетронутым. Так вы закрываете обучение, не теряя место в поисковой выдаче.
Чтобы, наоборот, явно всё разрешить, используйте Allow: / или просто не запрещайте бота.
Шаг 2. Главное ограничение robots.txt
Здесь нужна честность: robots.txt — это просьба, а не забор. Он не блокирует технически. Добросовестный бот его читает и уважает; недобросовестный — игнорирует и качает всё равно.
Крупные игроки (OpenAI, Anthropic, Google) свои директивы в целом соблюдают — им дорога репутация. Но полагаться только на robots.txt, если доступ для вас критичен, нельзя. Для настоящего запрета нужен следующий уровень.
Шаг 3. Блокировка на уровне сервера
Настоящий забор — это блокировка по User-Agent или через сервис-посредник. Тут бот не «просят» уйти, а физически не пускают.
- Через Cloudflare. Если сайт за Cloudflare, в панели есть переключатель блокировки ИИ-ботов — одной кнопкой закрываются известные обучающие краулеры. Для новых доменов такая блокировка всё чаще включена по умолчанию. Появился и механизм платного доступа (pay-per-crawl): бот либо платит по счёту, либо получает отказ — подробнее в нашей новости.
- Через правила сервера. На nginx или Apache можно отдавать ботам с известными User-Agent ответ
403 Forbidden. Это работает независимо от их доброй воли, но требует поддерживать список актуальным.
Шаг 4. Отдельные страницы через мета-тег
Если нужно закрыть не весь сайт, а конкретные страницы, помогает мета-тег в <head>:
<meta name="robots" content="noai, noimageai">
Директивы noai и noimageai сигнализируют, что текст и изображения страницы не следует использовать для обучения. Поддержка их пока неполная — это тоже просьба, а не блокировка, — но крупные краулеры их всё чаще учитывают.
Как выбрать уровень
| Задача | Инструмент |
|---|---|
| Мягко попросить не обучаться | robots.txt + мета-тег noai |
| Оставить поиск, закрыть обучение | Google-Extended: Disallow, поиск не трогать |
| Гарантированно не пустить | Блокировка на сервере / Cloudflare |
| Пустить за деньги | Cloudflare pay-per-crawl |
Частая ошибка
Запретить в robots.txt вообще всех, включая Googlebot, и выпасть из поиска. Всегда разделяйте: обучающих ботов закрывайте прицельно, а поисковых — оставляйте, иначе вместе с обучением вы отрежете себе и посетителей.
Что запомнить
- Сначала решите, кого пускаете: всех, только поиск или за плату.
robots.txt— просьба, её уважают крупные боты, но не все.- Для настоящего запрета нужна блокировка на сервере или через Cloudflare.
- Разделяйте поисковых и обучающих ботов — не закройте поиск заодно.
- Мета-тег
noaiзакрывает отдельные страницы, но тоже на доверии.
Что стоит за платным доступом ботов и как это меняет экономику обучения — в новости про Cloudflare pay-per-crawl.