Техническое SEO

Как правильно настроить robots.txt

Как настроить robots.txt, что закрывать от роботов, а что нет, и какие ошибки в этом файле стоят сайту трафика.

11 мин чтения

Что делает robots.txt

robots.txt — текстовый файл в корне сайта, который подсказывает поисковым роботам, какие разделы можно обходить. Это рекомендация, а не жёсткий запрет: добросовестные роботы Google и Яндекса её соблюдают.

Важно понимать ограничение: robots.txt управляет обходом, но не гарантирует исключение из индекса. Если страница заблокирована в robots.txt, но на неё есть внешние ссылки, Google может знать о ней и показывать в выдаче без описания. Для исключения из индекса нужен meta robots noindex.

Файл должен быть доступен по адресу https://example.com/robots.txt и отдавать код 200. Редирект или 404 на robots.txt — проблема: робот может обходить сайт без ограничений.

В robots.txt принято указывать директиву Sitemap: с полным URL карты сайта. Это помогает роботу быстрее найти sitemap.xml.

Что обычно закрывают

Закрывают от обхода разделы, которые не должны попадать в поиск и не несут SEO-ценности. Это экономит краулинговый бюджет на крупных сайтах.

Служебные и админ-разделы: /admin/, /wp-admin/, /bitrix/admin/ — не должны индексироваться и не должны тратить ресурсы робота.

Корзина, личный кабинет, результаты внутреннего поиска — страницы без уникального контента, которые создают дубли и мусор в индексе.

Технические страницы: печать, версии для мобильных приложений, API-endpoints. Также закрывают бесконечные комбинации фильтров, если они управляются через canonical, а не через robots.

Не закрывайте в robots.txt то, что хотите deindex — используйте noindex. Иначе робот не увидит тег и не исключит страницу.

  • Служебные и админ-разделы
  • Корзина, личный кабинет, результаты внутреннего поиска
  • Технические страницы без ценности

Синтаксис и примеры

Базовая структура: User-agent (для какого робота) + Disallow/Allow (что запрещено/разрешено). User-agent: * означает всех роботов.

Disallow: /admin/ — запрет обхода всего раздела /admin/. Disallow: /*?* — запрет URL с параметрами (осторожно: может закрыть нужные страницы).

Allow перекрывает Disallow для конкретного пути. Пример: Disallow: /catalog/ + Allow: /catalog/main/ — закрыт каталог, кроме главной страницы каталога.

Для Яндекса есть директива Clean-param — она указывает параметры URL, которые не меняют содержимое (utm, sessionid). Это альтернатива canonical для параметров.

Главные ошибки

Самая опасная ошибка — случайно закрыть важный раздел или весь сайт (Disallow: /). Такое случается после копирования robots.txt с тестового окружения. Сайт полностью выпадает из индекса.

Забывают указать sitemap — робот дольше находит новые страницы. Добавьте строку Sitemap: https://example.com/sitemap.xml.

Блокируют CSS и JS в robots.txt — Googlebot не может отрендерить страницу и может неправильно оценить контент. Не закрывайте /static/, /assets/, /wp-includes/.

Всегда проверяйте robots.txt после доработок сайта. SEOSCANUM при аудите проверяет robots.txt и показывает, какие важные URL заблокированы.

Частые вопросы

Нужно ли закрывать дубли в robots.txt?
Лучше управлять дублями через canonical или meta robots noindex — robots.txt не убирает страницу из индекса, а лишь запрещает обход. Закрытые в robots страницы с внешними ссылками всё равно могут быть в выдаче.
Можно ли закрыть сайт от конкретного робота?
Да, через User-agent. Например, User-agent: GPTBot + Disallow: / закроет сайт от обхода ChatGPT. Аналогично для других AI-ботов.

Проверьте свой сайт за пару минут

Запустите бесплатное демо-аудита — увидите главные проблемы без оплаты и без подписки.