Robots.txt
Также: файл robots.txt
Robots.txt — это текстовый файл в корне сайта, который сообщает поисковым роботам, какие разделы можно обходить, а какие пропускать. Стандартный инструмент управления краулингом.
Как работает
Файл лежит по адресу https://example.com/robots.txt — именно в корне домена, не в подпапке. При первом заходе на сайт бот запрашивает этот файл и подстраивает своё поведение под указанные правила. Формат простой: блоки директив, сгруппированные по имени робота.
User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /admin/help.html
Sitemap: https://example.com/sitemap.xml
User-agent: * — правила для всех роботов. Можно задать отдельные блоки для Googlebot, YandexBot, Bingbot. Disallow запрещает обход, Allow — разрешает исключение внутри запрещённого раздела. Директива Sitemap указывает путь к карте сайта. Яндекс дополнительно понимает Clean-param для склейки URL с параметрами.
Почему важно для SEO
Роботы получают ограниченный бюджет на обход сайта. Если бот тратит его на служебные страницы — фильтры, корзину, страницы поиска — до реально важных URL он доходит реже. Правильно настроенный robots.txt закрывает мусор и высвобождает бюджет для товарных и контентных страниц.
Важный нюанс: Disallow запрещает обход, но не индексацию. Если на закрытую страницу ведут внешние ссылки, Google может добавить её в индекс без содержимого — с пометкой «описание недоступно из-за robots.txt». Для гарантированного удаления из выдачи используют метатег noindex, но робот должен иметь возможность его прочитать, а значит страница не должна быть закрыта в robots.txt.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайтЧастые ошибки
Disallow: /в продакшене — сайт полностью выпадает из индекса.- Закрытие в robots.txt страниц с
noindex— робот не увидит тег и продолжит держать URL в индексе. - Блокировка CSS и JS — Google не сможет отрендерить страницу и оценит её как поломанную.
- Файл отдаёт 404 или 500 — Google трактует это как «всё разрешено», Яндекс как «всё запрещено».
- Кириллические URL без urlencode — правила не сработают.
- Пустая строка между директивами одного блока — некоторые парсеры разбивают блок надвое.
Как проверить
Откройте https://вашсайт/robots.txt в браузере — файл должен отдавать 200 OK и читаемое содержимое. В Google Search Central есть отчёт «Статистика сканирования» и инструмент «Тестирование файла robots.txt» в старой Search Console. Яндекс.Вебмастер даёт вкладку «Инструменты → Анализ robots.txt» с проверкой конкретных URL.
SEO Crawler запрашивает robots.txt в начале обхода, разбирает директивы и уважает их при сканировании. В отчёте вы увидите блок «Robots.txt»: доступность файла, найденные правила, конфликты с canonical и sitemap, URL, которые заблокированы вашими же правилами вопреки намерению.
Вывод
Robots.txt — первое, на что смотрит поисковик при заходе на сайт. Держите его минимальным, не закрывайте CSS и JS, помните, что запрет обхода не равен запрету индексации, и всегда указывайте путь к sitemap. После любых правок проверяйте файл в валидаторе Search Console — синтаксическая ошибка в одной строке ломает весь блок правил.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайт