ИИ ИИшка Про
Гайды

Как разрешить или запретить ИИ-ботам сканировать ваш сайт

AI-редакция

Ваш контент по умолчанию доступен ИИ-ботам, которые скачивают его для обучения моделей. Хотите вы этого или нет — решать вам, но сначала стоит понять, как вообще управлять доступом. Разберём по шагам: от простого robots.txt до блокировки на уровне сервера.

Шаг 0. Решите, чего вы хотите

Прежде чем что-то настраивать, определитесь. Возможны три позиции:

  • Пустить всех — контент попадёт в обучение моделей, взамен вы ничего не получаете, но и не теряете трафик. Позиция по умолчанию.
  • Запретить обучающим ботам — поисковики оставляем (они ведут людей на сайт), а тех, кто качает контент только для обучения, закрываем.
  • Пустить за плату — новый вариант через посредников вроде Cloudflare, о котором ниже.

Ключевое различие — между поисковым роботом и обучающим. Первый приводит вам посетителей, второй просто забирает текст. Часто их хочется развести: поиск разрешить, обучение запретить.

Шаг 1. robots.txt — базовый уровень

robots.txt — файл в корне сайта (ваш-домен.ру/robots.txt), где вы указываете, какому боту что можно. Формат простой: имя бота и запрет или разрешение путей.

Чтобы запретить конкретному ИИ-краулеру весь сайт:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Здесь GPTBot, ClaudeBot и Google-Extended — обучающие боты OpenAI, Anthropic и Google. Важная тонкость: Google-Extended управляет только обучением, а обычный Googlebot (поиск) остаётся нетронутым. Так вы закрываете обучение, не теряя место в поисковой выдаче.

Чтобы, наоборот, явно всё разрешить, используйте Allow: / или просто не запрещайте бота.

Шаг 2. Главное ограничение robots.txt

Здесь нужна честность: robots.txt — это просьба, а не забор. Он не блокирует технически. Добросовестный бот его читает и уважает; недобросовестный — игнорирует и качает всё равно.

Крупные игроки (OpenAI, Anthropic, Google) свои директивы в целом соблюдают — им дорога репутация. Но полагаться только на robots.txt, если доступ для вас критичен, нельзя. Для настоящего запрета нужен следующий уровень.

Шаг 3. Блокировка на уровне сервера

Настоящий забор — это блокировка по User-Agent или через сервис-посредник. Тут бот не «просят» уйти, а физически не пускают.

  • Через Cloudflare. Если сайт за Cloudflare, в панели есть переключатель блокировки ИИ-ботов — одной кнопкой закрываются известные обучающие краулеры. Для новых доменов такая блокировка всё чаще включена по умолчанию. Появился и механизм платного доступа (pay-per-crawl): бот либо платит по счёту, либо получает отказ — подробнее в нашей новости.
  • Через правила сервера. На nginx или Apache можно отдавать ботам с известными User-Agent ответ 403 Forbidden. Это работает независимо от их доброй воли, но требует поддерживать список актуальным.

Шаг 4. Отдельные страницы через мета-тег

Если нужно закрыть не весь сайт, а конкретные страницы, помогает мета-тег в <head>:

<meta name="robots" content="noai, noimageai">

Директивы noai и noimageai сигнализируют, что текст и изображения страницы не следует использовать для обучения. Поддержка их пока неполная — это тоже просьба, а не блокировка, — но крупные краулеры их всё чаще учитывают.

Как выбрать уровень

ЗадачаИнструмент
Мягко попросить не обучатьсяrobots.txt + мета-тег noai
Оставить поиск, закрыть обучениеGoogle-Extended: Disallow, поиск не трогать
Гарантированно не пуститьБлокировка на сервере / Cloudflare
Пустить за деньгиCloudflare pay-per-crawl

Частая ошибка

Запретить в robots.txt вообще всех, включая Googlebot, и выпасть из поиска. Всегда разделяйте: обучающих ботов закрывайте прицельно, а поисковых — оставляйте, иначе вместе с обучением вы отрежете себе и посетителей.

Что запомнить

  • Сначала решите, кого пускаете: всех, только поиск или за плату.
  • robots.txtпросьба, её уважают крупные боты, но не все.
  • Для настоящего запрета нужна блокировка на сервере или через Cloudflare.
  • Разделяйте поисковых и обучающих ботов — не закройте поиск заодно.
  • Мета-тег noai закрывает отдельные страницы, но тоже на доверии.

Что стоит за платным доступом ботов и как это меняет экономику обучения — в новости про Cloudflare pay-per-crawl.