На небольших и средних сайтах WordPress дубли чаще всего появляются не из-за контента, а из-за системных архивов: страницы авторов, даты, теги, вложения, пагинация и служебные URL. Проблема в том, что поисковик начинает индексировать десятки слабых страниц, а основной контент получает меньше внимания. Если сайт уже живет, а не только запускается, это обычно заметно по росту «мусорных» URL в индексе и по тому, что в отчете обхода много страниц без трафика.
Ниже — рабочая схема, как убрать дубли аккуратно: сначала понять, что именно индексируется, потом закрыть лишнее без поломки навигации и проверить, что изменения реально сработали.
Что именно считать дублями в WordPress
Не все архивы одинаково вредны. На практике чаще всего закрывают:
- архивы авторов, если на сайте один автор или страницы авторов не несут ценности;
- архивы по датам, если они дублируют ленту записей;
- страницы вложений, если медиа-страницы не используются как отдельные посадочные;
- теги, если они создают тонкие страницы с 1–2 записями;
- служебные страницы пагинации в тех разделах, где они не нужны для SEO.
При этом нельзя просто «всё noindex» без разбора. Если архив категории реально помогает пользователю и собирает трафик, его лучше оставить в индексе и улучшить, а не выключать.
Диагностика: где искать проблему
Сначала проверьте, что именно уже попало в индекс и какие URL создают лишний шум. Для этого удобно смотреть три источника: отчеты поисковой системы, карту сайта и саму структуру URL на сайте.
Что проверить вручную
- Есть ли в индексе страницы вида
/author/...,/date/...,/tag/...,/attachment/.... - Открываются ли страницы вложений как отдельные HTML-страницы вместо редиректа на файл или запись.
- Не дублируются ли заголовки и мета-описания на архивных страницах.
- Не создает ли плагин SEO отдельные архивы, которые вы не планировали индексировать.
Если у вас есть доступ к консоли поиска, посмотрите, какие URL получают показы, но не дают кликов. Это часто и есть кандидаты на закрытие.
Быстрая проверка через сайт
Можно пройтись по сайту и посмотреть исходный код страницы. Ищите в <head> мета-тег noindex, canonical и robots-правила. Если архив уже закрыт, но в индексе он остается, значит, либо закрытие сделано не там, либо поисковик еще не переобошел страницу.
<meta name=