Перейти к содержимому
Попробовать

Robots.txt

Также: файл robots.txt

Обновлено: 02.10.2026 4 просмотров

Robots.txt — это текстовый файл в корне сайта, который сообщает поисковым роботам, какие разделы можно обходить, а какие пропускать. Стандартный инструмент управления краулингом.

Как работает

Файл лежит по адресу https://example.com/robots.txt — именно в корне домена, не в подпапке. При первом заходе на сайт бот запрашивает этот файл и подстраивает своё поведение под указанные правила. Формат простой: блоки директив, сгруппированные по имени робота.

User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /admin/help.html

Sitemap: https://example.com/sitemap.xml

User-agent: * — правила для всех роботов. Можно задать отдельные блоки для Googlebot, YandexBot, Bingbot. Disallow запрещает обход, Allow — разрешает исключение внутри запрещённого раздела. Директива Sitemap указывает путь к карте сайта. Яндекс дополнительно понимает Clean-param для склейки URL с параметрами.

Почему важно для SEO

Роботы получают ограниченный бюджет на обход сайта. Если бот тратит его на служебные страницы — фильтры, корзину, страницы поиска — до реально важных URL он доходит реже. Правильно настроенный robots.txt закрывает мусор и высвобождает бюджет для товарных и контентных страниц.

Важный нюанс: Disallow запрещает обход, но не индексацию. Если на закрытую страницу ведут внешние ссылки, Google может добавить её в индекс без содержимого — с пометкой «описание недоступно из-за robots.txt». Для гарантированного удаления из выдачи используют метатег noindex, но робот должен иметь возможность его прочитать, а значит страница не должна быть закрыта в robots.txt.

Проверим весь сайт?

Пара минут — и увидите отчёт по каждой странице.

Проверить сайт
Или нужен взгляд SEO-специалиста? Оставить заявку →

Частые ошибки

  • Disallow: / в продакшене — сайт полностью выпадает из индекса.
  • Закрытие в robots.txt страниц с noindex — робот не увидит тег и продолжит держать URL в индексе.
  • Блокировка CSS и JS — Google не сможет отрендерить страницу и оценит её как поломанную.
  • Файл отдаёт 404 или 500 — Google трактует это как «всё разрешено», Яндекс как «всё запрещено».
  • Кириллические URL без urlencode — правила не сработают.
  • Пустая строка между директивами одного блока — некоторые парсеры разбивают блок надвое.

Как проверить

Откройте https://вашсайт/robots.txt в браузере — файл должен отдавать 200 OK и читаемое содержимое. В Google Search Central есть отчёт «Статистика сканирования» и инструмент «Тестирование файла robots.txt» в старой Search Console. Яндекс.Вебмастер даёт вкладку «Инструменты → Анализ robots.txt» с проверкой конкретных URL.

SEO Crawler запрашивает robots.txt в начале обхода, разбирает директивы и уважает их при сканировании. В отчёте вы увидите блок «Robots.txt»: доступность файла, найденные правила, конфликты с canonical и sitemap, URL, которые заблокированы вашими же правилами вопреки намерению.

Вывод

Robots.txt — первое, на что смотрит поисковик при заходе на сайт. Держите его минимальным, не закрывайте CSS и JS, помните, что запрет обхода не равен запрету индексации, и всегда указывайте путь к sitemap. После любых правок проверяйте файл в валидаторе Search Console — синтаксическая ошибка в одной строке ломает весь блок правил.

Проверим весь сайт?

Пара минут — и увидите отчёт по каждой странице.

Проверить сайт
Или нужен взгляд SEO-специалиста? Оставить заявку →

Смотрите также