Как правильно настроить robots.txt
Как настроить robots.txt, что закрывать от роботов, а что нет, и какие ошибки в этом файле стоят сайту трафика.
11 мин чтения
Что делает robots.txt
robots.txt — текстовый файл в корне сайта, который подсказывает поисковым роботам, какие разделы можно обходить. Это рекомендация, а не жёсткий запрет: добросовестные роботы Google и Яндекса её соблюдают.
Важно понимать ограничение: robots.txt управляет обходом, но не гарантирует исключение из индекса. Если страница заблокирована в robots.txt, но на неё есть внешние ссылки, Google может знать о ней и показывать в выдаче без описания. Для исключения из индекса нужен meta robots noindex.
Файл должен быть доступен по адресу https://example.com/robots.txt и отдавать код 200. Редирект или 404 на robots.txt — проблема: робот может обходить сайт без ограничений.
В robots.txt принято указывать директиву Sitemap: с полным URL карты сайта. Это помогает роботу быстрее найти sitemap.xml.
Что обычно закрывают
Закрывают от обхода разделы, которые не должны попадать в поиск и не несут SEO-ценности. Это экономит краулинговый бюджет на крупных сайтах.
Служебные и админ-разделы: /admin/, /wp-admin/, /bitrix/admin/ — не должны индексироваться и не должны тратить ресурсы робота.
Корзина, личный кабинет, результаты внутреннего поиска — страницы без уникального контента, которые создают дубли и мусор в индексе.
Технические страницы: печать, версии для мобильных приложений, API-endpoints. Также закрывают бесконечные комбинации фильтров, если они управляются через canonical, а не через robots.
Не закрывайте в robots.txt то, что хотите deindex — используйте noindex. Иначе робот не увидит тег и не исключит страницу.
- Служебные и админ-разделы
- Корзина, личный кабинет, результаты внутреннего поиска
- Технические страницы без ценности
Синтаксис и примеры
Базовая структура: User-agent (для какого робота) + Disallow/Allow (что запрещено/разрешено). User-agent: * означает всех роботов.
Disallow: /admin/ — запрет обхода всего раздела /admin/. Disallow: /*?* — запрет URL с параметрами (осторожно: может закрыть нужные страницы).
Allow перекрывает Disallow для конкретного пути. Пример: Disallow: /catalog/ + Allow: /catalog/main/ — закрыт каталог, кроме главной страницы каталога.
Для Яндекса есть директива Clean-param — она указывает параметры URL, которые не меняют содержимое (utm, sessionid). Это альтернатива canonical для параметров.
Главные ошибки
Самая опасная ошибка — случайно закрыть важный раздел или весь сайт (Disallow: /). Такое случается после копирования robots.txt с тестового окружения. Сайт полностью выпадает из индекса.
Забывают указать sitemap — робот дольше находит новые страницы. Добавьте строку Sitemap: https://example.com/sitemap.xml.
Блокируют CSS и JS в robots.txt — Googlebot не может отрендерить страницу и может неправильно оценить контент. Не закрывайте /static/, /assets/, /wp-includes/.
Всегда проверяйте robots.txt после доработок сайта. SEOSCANUM при аудите проверяет robots.txt и показывает, какие важные URL заблокированы.
Частые вопросы
Нужно ли закрывать дубли в robots.txt?
Можно ли закрыть сайт от конкретного робота?
Читайте также
Почему страницы не индексируются и как это исправить
Основные причины, по которым страницы не индексируются, и пошаговый план, как вернуть их в поиск.
Как правильно настроить canonical
Как работает canonical, где он нужен и какие ошибки в нём приводят к выпадению страниц из индекса.
Как найти и убрать дубли страниц
Виды дублей, их вред для SEO и практические способы устранения — от canonical до редиректов.
Проверьте свой сайт за пару минут
Запустите бесплатное демо-аудита — увидите главные проблемы без оплаты и без подписки.