Все посты
Обновлено 9999+ 5 Знания

Robots.txt: настройка сканирования и отличие от noindex

Как настроить robots.txt и не перепутать запрет сканирования с удалением страницы из поискового индекса.

Что делает robots.txt

robots.txt — текстовый файл с правилами обхода сайта поисковыми роботами. Он управляет сканированием, а не гарантированным удалением URL из индекса. Правила помогают не расходовать обход на дубли, параметры и служебные разделы, а также указывают адрес Sitemap.

URL, запрещённый через Disallow, всё равно может появиться в поиске, если робот узнает о нём по внешним или внутренним ссылкам. Контент Googlebot не прочитает, но адрес и текст ссылок могут попасть в результат. Поэтому robots.txt нельзя использовать для защиты паролей, персональных данных и других секретов.

Где разместить файл

Файл должен называться robots.txt, быть доступен в корне конкретного протокола, хоста и порта, например https://example.com/robots.txt, и возвращать HTTP 200. Правила этого файла не распространяются автоматически на поддомены.

Используйте UTF-8. Пути в правилах регистрозависимы. Для IDN-домена в строках правил допустимо использовать Punycode; URL Sitemap указывают полностью.

Основные директивы

User-agent: *
Disallow: /admin/
Allow: /admin/public-page

Sitemap: https://example.com/sitemap.xml
  • User-agent выбирает робота или группу роботов.
  • Disallow запрещает обход пути.
  • Allow создаёт исключение внутри запрета.
  • Sitemap сообщает полный URL карты сайта.
  • Clean-param — директива Яндекса для устранения лишних параметров URL при обходе; Google её не поддерживает.

Disallow и Allow на практике

Disallow запрещает роботам сканировать страницы по указанному адресу или целый каталог. Например, /folder/ запрещает пути внутри этого каталога, а / — весь сайт. Звёздочка * обозначает произвольную последовательность символов, $ — конец URL.

User-agent: Googlebot
Disallow: /*.pdf$

Этот пример запрещает Googlebot обход URL, оканчивающихся на .pdf; вариант с параметрами после расширения под него не попадёт. Для удаления PDF из поиска используйте доступный роботу ответ с X-Robots-Tag: noindex.

Основная роль Allow — в том, чтобы создавать исключения из уже указанных правил. Так, например, можно запретить Google сканировать весь сайт, кроме блога:

User-agent: Googlebot
Allow: /blog/
Disallow: /

Google выбирает самое конкретное совпадающее правило, а при равной длине разрешение имеет преимущество. Это не список команд, где последняя строка обязательно отменяет предыдущую.

Одна строка содержит одно правило. Не перечисляйте пути через запятую. Пустой Disallow: ничего не запрещает. Для разных роботов можно создавать отдельные группы.

Пример для параметров в Яндексе:

User-agent: Yandex
Clean-param: sort&order /catalog/

Не закрывайте все URL с ? без аудита: параметры могут вести на полезные страницы. Каноникализация, внутренние ссылки и параметры в CMS часто решают проблему точнее.

Crawling и indexing: как не перепутать

Disallow мешает роботу загрузить страницу. noindex запрещает показывать доступную страницу в поиске. Чтобы Google или Яндекс увидели метатег или HTTP-заголовок noindex, URL должен быть разрешён для обхода:

<meta name="robots" content="noindex">

или:

X-Robots-Tag: noindex

Не сочетайте Disallow и noindex для удаления уже известного URL: заблокированный робот не сможет прочитать noindex. Директива noindex внутри самого robots.txt Google не поддерживается.

После снятия noindex отдельного «штрафа» не остаётся. Страница сможет вернуться после нового обхода и обработки, но это может занять время. Для Google можно запросить переобход в URL Inspection.

Как выбрать способ закрытия

  • Страница нужна пользователям, но не поиску: оставьте обход доступным и используйте noindex.
  • Страница удалена навсегда: верните 404 или 410 и удалите её из Sitemap и внутренних ссылок.
  • Есть точная актуальная замена: настройте 301 на неё.
  • Контент конфиденциальный или тестовый: закройте авторизацией. Robots.txt не является контролем доступа.
  • Нужно временно срочно скрыть результат: используйте Removals в Google Search Console или удаление страниц в Яндекс Вебмастере и одновременно настройте постоянный метод.

nofollow на внутренних ссылках не защищает целевую страницу от обнаружения и не должен использоваться как способ закрытия. Коды 401/403 ограничивают доступ, а 404/410 обозначают отсутствующий ресурс; выбирайте статус по реальному состоянию URL.

Проверка robots.txt

После изменения проверьте файл в инструментах Google Search Console и Яндекс Вебмастера, затем протестируйте несколько разрешённых и запрещённых URL. Убедитесь, что CSS и JavaScript, нужные для рендеринга важных страниц, открыты роботам.

Правила должны решать конкретную задачу. Чем короче и понятнее файл, тем меньше риск случайно закрыть раздел сайта.

Анализ сайта

Улучшите ваш сайт

Подключите свой сайт к нам, чтобы отслеживать позиции и выявлять ошибки с максимальным комфортом. Вы будете получать уведомления обо всех изменениях на вашем сайте в течение суток — еще до того, как проблема станет серьезной.

Подключить

Официальная документация

Возьмите под контроль продвижение своего сайта
Исправьте ошибки, которые мешают сайту выйти в топ, и вы увидите рост трафика и дохода.
🔍 Подпишись на @prcynews в телеграм — оставайся в курсе последних SEO новостей и свежих материалов.

Теги поста или какие разделы почитать еще:

Комментарии (5)
Seyon7   29.01.2019 13:29
Директива host давно устарела https://yandex.ru/blog/webmaster/301-y-redirekt-polnostyu-zamenil-direktivu-host
Elena_Zhmurina   29.01.2019 13:46
Спасибо! Забыли упомянуть об этом.
paxey   29.01.2019 21:17
У вас много опечаток (html-код) там, где пример кода, в основном с sitemap.
Спасибо, код слетел, но уже поправили!
Master2390   14.01.2024 00:36
Спасибо за информацию
Подскажите, что по поводу скрытия файла роботс из поисковой системы? Где то слышал надо запрещать его индексацию в пс (а также и сайтмэп) через команду в htacess
К данной записи нельзя добавлять комментарии, т.к. она очень старая.
llms.txt: что это, нужен ли сайту и как создать файл в 2026 году
SEO-продвижение сайта на WordPress в 2026 году: пошаговый гайд с настройкой и чек-листом
Метатеги сайта: полный гайд по Title, Description, Canonical, Robots и другим тегам
Hermes Agent для SEO: как установить ИИ-агента и подключить к нему данные сайта
Как перевести сайт на новую CMS без потери трафика (и вырасти в поиске вдвое)
Mobile-first индексация Google: как подготовить сайт и не потерять позиции