Дубли контента
Также: Duplicate content
Дубли контента — это страницы с одинаковым или почти одинаковым содержимым, доступные по разным URL. Основная причина, по которой Google склеивает страницы в выдаче и распыляет ссылочный вес.
Как работает
Дубли возникают, когда одна и та же страница отвечает на несколько URL: с параметрами, разным регистром, слэшем на конце, протоколом, поддоменом. Для пользователя это одна страница, для поисковика — несколько разных, конкурирующих за одну и ту же позицию.
Типовые источники внутри сайта:
- параметры фильтров и сортировок:
/kettle/?sort=priceи/kettle/?sort=name - UTM-метки:
/kettle/?utm_source=vkи/kettle/ - сессионные идентификаторы:
/kettle/?sid=abc123 - слэш и без:
/kettle/и/kettle - HTTP и HTTPS, www и без www
- версия для печати:
/kettle/print/
Внешние дубли — когда контент скопирован на другой домен. Google обычно определяет оригинал по дате первой индексации и внешним ссылкам, но при высокой авторитетности копии может выбрать её как основную.
Основные инструменты борьбы — canonical, 301-редирект, склейка через robots.txt:
<link rel="canonical" href="https://example.com/kettle/">
Почему важно для SEO
Google Search Central подтверждает: дубли не наказываются штрафом, но разрушают ранжирование по-другому. Внешние ссылки на разные версии распыляются, поведенческие сигналы делятся между URL, поисковик может выбрать в выдачу не ту версию, которую хотел вебмастер.
На большом сайте — интернет-магазине с фильтрами, портале с UTM-метками — дубли забирают краулинговый бюджет: робот тратит запросы на копии вместо новых страниц. По статистике Google, до 30% обхода на средних e-commerce уходит на URL с параметрами — при закрытии их через canonical или robots.txt проиндексированность растёт на 20-40% в течение месяца.
Яндекс.Вебмастер отдельно ведёт раздел «Индексирование → Страницы в поиске → Исключённые», где помечает URL со статусом «Дубль». Если таких много — сайт получает пометку в диагностике, и позиции по вторичным запросам проседают.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайтЧастые ошибки
- Массовые параметры фильтров без canonical на чистый URL — тысячи дублей одной категории.
- Отсутствие 301 при переходе на HTTPS — старые HTTP-версии остаются в индексе как самостоятельные страницы.
- UTM-метки индексируются вместе с оригиналом — обычно нужен запрет на уровне robots.txt или canonical.
- Страница
/index.htmlи корень сайта/доступны по обоим URL без склейки — два дубля с главной. - Пагинация без canonical на первую страницу или без rel="next"/rel="prev" — каждая страница пагинации попадает в индекс отдельно.
- Копия контента на партнёрском сайте без ссылки на оригинал — Google может выбрать копию как основную.
Как проверить
В Google Search Console раздел «Индексирование страниц → Не проиндексировано» показывает причины исключения: «Страница является дубликатом; отправленный URL не выбран как канонический» — прямой сигнал о проблеме. В Яндекс.Вебмастере — «Индексирование → Страницы в поиске → Исключённые», статус «Дубль».
SEO Crawler ищет дубли двумя способами: по совпадению content hash (полная копия) и по коэффициенту схожести контента (частичные дубли — например, карточки товара, отличающиеся только цветом). В отчёте это блок «Дубли» с приоритизацией правок по количеству затронутых URL и потерянного краулингового бюджета.
Вывод
Дубли — не штраф, а фоновая утечка сигналов ранжирования и краулингового бюджета. Ставьте self-referencing canonical на всех индексируемых страницах, склеивайте www/без www и HTTP/HTTPS через 301, закрывайте параметры сортировок и UTM от индексации, следите за отчётом дублей в Search Console после каждого крупного изменения структуры URL.
Проверим весь сайт?
Пара минут — и увидите отчёт по каждой странице.
Проверить сайт