Краулинг
Также: Сканирование сайта, Crawling
Краулинг — это обход сайта поисковым роботом: он переходит по ссылкам, загружает страницы и извлекает из них новые URL. С краулинга начинается путь любой страницы в поиск — без обхода не будет ни индексации, ни позиций.
Как работает
Робот стартует с адресов, которые уже знает: URL из sitemap, ранее обойдённые страницы, ссылки с других сайтов. Каждый адрес попадает в очередь обхода. Бот запрашивает страницу, получает HTML, вытаскивает из него ссылки и добавляет новые URL в ту же очередь. Обход расходится волной от главной вглубь каталога.
Перед каждым запросом робот сверяется с robots.txt. Закрытый раздел в очередь не попадёт. Порядок обхода не случаен: страницы ближе к главной и те, что часто обновляются, робот посещает первыми.
Для сайтов на JavaScript добавляется рендеринг. Googlebot сначала забирает исходный HTML, а отрисовку через Chromium откладывает в отдельную очередь — она может отставать на часы или дни.
66.249.66.1 - - [15/Sep/2026:10:22:01] "GET /catalog/kettles/ HTTP/1.1" 200
"Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
Почему важно для SEO
Обход — обязательный первый этап. Страница, которую робот не нашёл или не смог загрузить, не попадёт в индекс, каким бы качественным ни был её контент. От полноты и скорости обхода зависит, как быстро новые товары и статьи начнут собирать трафик.
На крупных сайтах краулинг упирается в лимит ресурсов — краулинговый бюджет. Когда робот тратит его на бесконечные фильтры, дубли с параметрами и цепочки редиректов, до важных страниц он доходит реже и обновляет их позже. Понятная структура внутренних ссылок и актуальный sitemap ускоряют обнаружение новых URL.
Скорость обхода напрямую зависит от того, как отвечает сервер. Стабильный ответ 200 без всплесков ошибок и задержек позволяет роботу обойти больше страниц за то же время, а частые таймауты и коды 5xx заставляют его сбавить темп на дни вперёд. На новостных и товарных сайтах, где важна свежесть, разница в частоте обхода определяет, попадёт ли материал в выдачу в первый день или спустя неделю. Отдельно стоит следить за цепочками редиректов: каждый лишний переход — это дополнительный запрос, который робот тратит вместо загрузки полезной страницы.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайтЧастые ошибки
- Важные страницы закрыты в robots.txt — робот до них просто не доходит.
- Навигация построена на JavaScript-обработчиках вместо тегов
<a href>— бот не распознаёт такие переходы как ссылки. - Глубокая вложенность: до товара шесть и более кликов от главной — робот заходит туда редко.
- Медленный ответ сервера — при росте времени загрузки Google снижает частоту обхода.
- Ловушки из бесконечных URL (календари, комбинации фильтров) — робот вязнет и расходует бюджет впустую.
Как проверить
В Google Search Console откройте отчёт «Статистика сканирования»: там видно, сколько страниц в день обходит Googlebot, какие коды ответа он получает и сколько времени уходит на загрузку. В Яндекс.Вебмастере аналогичные данные — в разделе «Индексирование → Статистика обхода». Самый точный источник — логи сервера: по ним видно, какие URL и как часто посещает бот.
SEO Crawler повторяет логику поискового робота: обходит сайт по внутренним ссылкам, строит карту достижимых страниц и показывает, до каких URL обход не дошёл. В отчёте SEO Crawler это разделы о структуре обхода, глубине вложенности и заблокированных страницах.
Вывод
Краулинг — фундамент, на котором держится всё остальное SEO. Дайте роботу чистую структуру ссылок, не закрывайте нужные разделы в robots.txt и следите за скоростью ответа сервера. Страница, до которой робот не дошёл, для поиска не существует.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайт