Что делает robots.txt
robots.txt — текстовый файл с правилами обхода сайта поисковыми роботами. Он управляет сканированием, а не гарантированным удалением URL из индекса. Правила помогают не расходовать обход на дубли, параметры и служебные разделы, а также указывают адрес Sitemap.
URL, запрещённый через Disallow, всё равно может появиться в поиске, если робот узнает о нём по внешним или внутренним ссылкам. Контент Googlebot не прочитает, но адрес и текст ссылок могут попасть в результат. Поэтому robots.txt нельзя использовать для защиты паролей, персональных данных и других секретов.
Где разместить файл
Файл должен называться robots.txt, быть доступен в корне конкретного протокола, хоста и порта, например https://example.com/robots.txt, и возвращать HTTP 200. Правила этого файла не распространяются автоматически на поддомены.
Используйте UTF-8. Пути в правилах регистрозависимы. Для IDN-домена в строках правил допустимо использовать Punycode; URL Sitemap указывают полностью.
Основные директивы
User-agent: *
Disallow: /admin/
Allow: /admin/public-page
Sitemap: https://example.com/sitemap.xml
User-agentвыбирает робота или группу роботов.Disallowзапрещает обход пути.Allowсоздаёт исключение внутри запрета.Sitemapсообщает полный URL карты сайта.Clean-param— директива Яндекса для устранения лишних параметров URL при обходе; Google её не поддерживает.
Disallow и Allow на практике
Disallow запрещает роботам сканировать страницы по указанному адресу или целый каталог. Например, /folder/ запрещает пути внутри этого каталога, а / — весь сайт. Звёздочка * обозначает произвольную последовательность символов, $ — конец URL.
User-agent: Googlebot
Disallow: /*.pdf$
Этот пример запрещает Googlebot обход URL, оканчивающихся на .pdf; вариант с параметрами после расширения под него не попадёт. Для удаления PDF из поиска используйте доступный роботу ответ с X-Robots-Tag: noindex.
Основная роль Allow — в том, чтобы создавать исключения из уже указанных правил. Так, например, можно запретить Google сканировать весь сайт, кроме блога:
User-agent: Googlebot
Allow: /blog/
Disallow: /
Google выбирает самое конкретное совпадающее правило, а при равной длине разрешение имеет преимущество. Это не список команд, где последняя строка обязательно отменяет предыдущую.
Одна строка содержит одно правило. Не перечисляйте пути через запятую. Пустой Disallow: ничего не запрещает. Для разных роботов можно создавать отдельные группы.
Пример для параметров в Яндексе:
User-agent: Yandex
Clean-param: sort&order /catalog/
Не закрывайте все URL с ? без аудита: параметры могут вести на полезные страницы. Каноникализация, внутренние ссылки и параметры в CMS часто решают проблему точнее.
Crawling и indexing: как не перепутать
Disallow мешает роботу загрузить страницу. noindex запрещает показывать доступную страницу в поиске. Чтобы Google или Яндекс увидели метатег или HTTP-заголовок noindex, URL должен быть разрешён для обхода:
<meta name="robots" content="noindex">
или:
X-Robots-Tag: noindex
Не сочетайте Disallow и noindex для удаления уже известного URL: заблокированный робот не сможет прочитать noindex. Директива noindex внутри самого robots.txt Google не поддерживается.
После снятия noindex отдельного «штрафа» не остаётся. Страница сможет вернуться после нового обхода и обработки, но это может занять время. Для Google можно запросить переобход в URL Inspection.
Как выбрать способ закрытия
- Страница нужна пользователям, но не поиску: оставьте обход доступным и используйте
noindex. - Страница удалена навсегда: верните 404 или 410 и удалите её из Sitemap и внутренних ссылок.
- Есть точная актуальная замена: настройте 301 на неё.
- Контент конфиденциальный или тестовый: закройте авторизацией. Robots.txt не является контролем доступа.
- Нужно временно срочно скрыть результат: используйте Removals в Google Search Console или удаление страниц в Яндекс Вебмастере и одновременно настройте постоянный метод.
nofollow на внутренних ссылках не защищает целевую страницу от обнаружения и не должен использоваться как способ закрытия. Коды 401/403 ограничивают доступ, а 404/410 обозначают отсутствующий ресурс; выбирайте статус по реальному состоянию URL.
Проверка robots.txt
После изменения проверьте файл в инструментах Google Search Console и Яндекс Вебмастера, затем протестируйте несколько разрешённых и запрещённых URL. Убедитесь, что CSS и JavaScript, нужные для рендеринга важных страниц, открыты роботам.
Правила должны решать конкретную задачу. Чем короче и понятнее файл, тем меньше риск случайно закрыть раздел сайта.
Улучшите ваш сайт
Подключите свой сайт к нам, чтобы отслеживать позиции и выявлять ошибки с максимальным комфортом. Вы будете получать уведомления обо всех изменениях на вашем сайте в течение суток — еще до того, как проблема станет серьезной.
Подключить