Дубли страниц на сайте: откуда берутся и чем вредят

В Яндекс Вебмастере у сайта из ста двадцати страниц числится четыре тысячи. Владелец радуется: «Смотрите, как много страниц в поиске!» Через месяц позиции ползут вниз, а нужные страницы то появляются в выдаче, то исчезают, и вместо страницы услуги поиск показывает какой-то обрывок каталога с параметрами в адресе. Это классическая картина при массовых дублях. Проблема кажется технической мелочью, но именно она чаще всего мешает нормальным сайтам занимать позиции, которых они заслуживают. Разберём, откуда берутся дубли, как их найти и чем закрывать.
Что считается дублем
Дубль — это ситуация, когда одно и то же содержимое доступно по нескольким адресам. Поиск видит несколько разных страниц с одинаковым или почти одинаковым наполнением и вынужден выбирать, какую показывать.
Различают два вида.
Полные дубли. Содержимое совпадает целиком. Обычно возникают из-за технических особенностей: адрес со слэшем на конце и без, с приставкой и без неё, с параметрами и без, доступность через служебные пути.
Частичные дубли. Совпадает большая часть страницы. Это страницы пагинации, где меняется только список товаров, карточки товаров, отличающиеся одним параметром, версии для печати, страницы фильтрации, страницы с сортировкой.
Отдельно стоит выделить смысловые дубли — разные адреса, разное оформление, но по сути один и тот же ответ на один и тот же запрос. Три страницы «ремонт квартир», «ремонт квартир под ключ» и «отделка квартир» с почти идентичными текстами конкурируют между собой и мешают друг другу.
Чем дубли вредят
Аргумент «ну есть и есть, никому не мешает» неверен по нескольким причинам.
Поиск показывает не ту страницу. Из нескольких одинаковых адресов система выбирает один, и выбор далеко не всегда совпадает с вашим. Вместо аккуратной страницы услуги в выдаче оказывается версия для печати или страница с параметрами сортировки.
Позиции скачут. Сегодня в поиске одна версия, завтра другая. Каждая смена — обнуление накопленных показателей, и страница начинает набирать позиции заново.
Размывается значимость. Внутренние и внешние ссылки распределяются между дублями вместо того, чтобы усиливать одну страницу.
Тратится ресурс обхода. У каждого сайта есть ограничение на количество страниц, которые робот обходит за визит. Если из четырёх тысяч адресов три тысячи девятьсот — мусор, робот тратит время на него, а новые нужные страницы попадают в поиск с большой задержкой.
Сайт получает оценку «много малополезных страниц». Массовые дубли — один из признаков, по которым сайт может понизиться целиком.
Искажается статистика. Просмотры одной страницы размазываются между несколькими адресами, и в отчётах не видно реальной картины.
Откуда берутся дубли: полный разбор причин
Слэш на конце адреса. Страница открывается и с косой чертой в конце, и без неё. Для поиска это два разных адреса.
Приставка перед именем домена. Адрес с тремя буквами перед доменом и без них. Плюс варианты с защищённым и незащищённым соединением. В сумме получается до четырёх версий одной и той же страницы.
Главная страница по нескольким адресам. Помимо корневого адреса она часто доступна через имя стартового файла. Это классический дубль главной, который встречается на большинстве сайтов.
Регистр букв в адресе. На части серверов адреса с большой и маленькой буквой считаются разными.
Параметры сортировки и отображения. В каталоге человек выбирает «сначала дешёвые» или «показывать по сорок» — и к адресу добавляется параметр. Каждое сочетание порождает новый адрес с тем же содержимым.
Фильтры каталога. Самая массовая причина на сайтах магазинов. Комбинаторика фильтров даёт тысячи и десятки тысяч адресов. Часть из них полезна и должна быть в поиске, большинство — мусор.
Метки источников трафика. Ссылки из рекламы и рассылок содержат служебные метки. Каждая метка создаёт новый адрес. Если такие ссылки попадают в поиск, дубли множатся.
Пагинация. Вторая, третья, десятая страница списка. Содержимое разное, но заголовок, описание и текст внизу одинаковые.
Версии для печати. Отдельный адрес с тем же текстом.
Один товар в нескольких разделах каталога. Карточка доступна по разным путям в зависимости от того, откуда пришёл посетитель.
Идентификаторы сессий. Устаревшая, но встречающаяся практика: к адресу добавляется уникальный код посетителя.
Разные адреса после переезда. Старая структура осталась доступной, новая появилась, переадресация не настроена.
Тестовая копия сайта. Копия на поддомене или на отдельном адресе, забытая после разработки и не закрытая от индексации. Полный дубль всего сайта — худший из возможных вариантов.
Автоматически создаваемые страницы. Архивы по датам, страницы меток, страницы автора — в системах управления сайтом их часто плодится больше, чем полезного содержимого.
Как найти дубли
Яндекс Вебмастер — основной инструмент. В разделе со страницами в поиске есть перечень исключённых страниц с указанием причины. Формулировка о дубле там прямая. Изучите этот список внимательно: он покажет и количество, и типовые схемы образования адресов.
Проверка вручную за пять минут. Откройте главную страницу и попробуйте несколько вариантов адреса: со слэшем и без, с приставкой и без, через имя стартового файла, с добавленным произвольным параметром. Если все варианты открываются и отдают одну и ту же страницу без переадресации — дубли есть.
Поиск по фрагменту текста. Возьмите характерное предложение со страницы и поищите его в кавычках вместе с указанием вашего сайта. Если найдётся несколько адресов — это дубли.
Обход сайта программой-сканером. Любая утилита, обходящая сайт по ссылкам, покажет страницы с одинаковыми заголовками и описаниями. Совпадающие заголовки — самый надёжный признак дублей.
Проверка карты сайта. Иногда карта содержит адреса в одном виде, а ссылки внутри сайта — в другом. Это само по себе создаёт разночтения.
Отчёт по страницам входа в Яндекс Метрике. Если в списке видны адреса с параметрами, идентификаторами, служебными путями — значит, люди на них попадают, а следовательно, они в поиске.
Проверка количества. Сравните число страниц, найденных роботом, с реальным количеством содержательных страниц сайта. Расхождение в разы — сигнал.
Чем закрывать дубли: инструменты и когда что применять
Инструментов несколько, и каждый решает свою задачу. Главная ошибка — использовать не тот.
Постоянная переадресация. Когда есть один правильный адрес, а остальные должны просто на него вести. Это основной инструмент для технических дублей: слэш, приставка, защищённое соединение, имя стартового файла, старые адреса после переезда. Переадресация передаёт накопленную значимость на правильный адрес, поэтому её предпочитают всем остальным способам, когда это возможно.
Указание основного адреса страницы. Специальная строка в коде страницы, сообщающая поиску, какой адрес считать главным. Применяется, когда страница должна оставаться доступной для людей, но в поиске должна участвовать только одна версия. Типовые случаи: карточка товара, доступная из разных разделов; страницы с параметрами сортировки; версии для печати.
Важная деталь: это рекомендация, а не команда. Если содержимое страниц заметно различается, поиск может её проигнорировать. Поэтому там, где возможна переадресация, лучше использовать её.
Специальная директива для незначащих параметров. В файле с правилами обхода можно указать, какие параметры адреса не влияют на содержимое. Это самый аккуратный способ борьбы с метками источников, сортировками и идентификаторами сессий: страницы объединяются, а показатели не теряются.
Запрет обхода в файле правил. Подходит для служебных разделов: корзина, личный кабинет, результаты внутреннего поиска, административная часть. Важно понимать ограничение: запрет обхода не гарантирует отсутствия адреса в поиске, если на него ведут ссылки. И значимость по таким страницам не передаётся.
Служебное указание о запрете индексации в коде страницы. Более надёжный способ убрать страницу из поиска, чем запрет обхода. Применяется для страниц, которые нужны людям, но не нужны в выдаче: страницы пагинации в некоторых схемах, страницы результатов фильтрации, служебные разделы.
Есть тонкость: чтобы робот увидел это указание, страница не должна быть закрыта от обхода. Одновременный запрет обхода и указание в коде — распространённая ошибка, при которой не работает ни то, ни другое.
Уникализация содержимого. Если страницы действительно должны быть разными и обе нужны в поиске — надо сделать их разными по существу: свои заголовки, свои описания, свои тексты. Это относится к смысловым дублям и к страницам под похожие запросы.
Объединение страниц. Иногда правильное решение — не разводить дубли, а слить их в одну сильную страницу и настроить переадресацию с остальных. Три слабые страницы по одной теме почти всегда проигрывают одной подробной.
Отдельно про фильтры каталога
Это самая частая головная боль магазинов, поэтому разберём подробнее.
Комбинации фильтров дают огромное количество адресов. Оставить всё открытым — значит завалить поиск мусором. Закрыть всё — потерять трафик по низкочастотным запросам, а он в каталоге очень заметен.
Рабочий подход — разделить фильтры на две группы.
Полезные сочетания открываем. Те, по которым реально ищут: «холодильники двухкамерные», «кабель медный 2.5», «двери межкомнатные белые». Такая страница получает собственный заголовок, собственное описание и, желательно, небольшой уникальный текст. Она становится полноценной посадочной страницей.
Все остальные комбинации закрываем. Особенно сочетания трёх и более фильтров, диапазоны цен, сортировки. Для них используется указание основного адреса на страницу категории или запрет индексации.
Определить полезные сочетания помогает Яндекс Вордстат: если у сочетания есть частотность, страницу имеет смысл открывать.
Пагинация: как правильно
Единого универсального решения нет, но есть здравый подход.
Вторая и последующие страницы списка должны быть доступны роботу — иначе он не доберётся до товаров, которые на них находятся. Но в поиске должна участвовать первая страница.
Практическая схема: страницы пагинации оставляют открытыми для обхода, к заголовку и описанию добавляют номер страницы, чтобы они не совпадали, текст внизу выводят только на первой странице, а в поиске приоритет отдают первой странице. Дополнительно полезно указывать связь между соседними страницами списка служебными ссылками.
Чего делать не стоит: закрывать пагинацию от обхода полностью — так часть товаров вообще не попадёт в поиск.
Порядок действий: как навести порядок
Последовательность, которая работает.
Первое — определитесь с основным видом адресов: со слэшем или без, с приставкой или без. Решение произвольное, важно лишь придерживаться его везде.
Второе — настройте переадресацию всех технических вариантов на основной вид. Проверьте на нескольких страницах разных типов.
Третье — закройте тестовые копии сайта, если они существуют. Это самый опасный вид дублей.
Четвёртое — выгрузите из Яндекс Вебмастера список страниц, исключённых как дубли, и разберите его по типам. Обычно обнаруживается три-четыре схемы, порождающие девяносто процентов мусора.
Пятое — для параметров сортировки, меток и идентификаторов настройте директиву незначащих параметров.
Шестое — разберитесь с фильтрами каталога: откройте полезные сочетания, закройте остальные.
Седьмое — проверьте заголовки и описания страниц на совпадения. Массовые одинаковые заголовки — либо дубли, либо незаполненные шаблоны.
Восьмое — приведите к единому виду все внутренние ссылки и карту сайта. Ссылки должны вести только на основные адреса.
Девятое — через две-три недели вернитесь в Вебмастер и посмотрите динамику. Число исключённых как дубли должно снижаться, число страниц в поиске — расти.
Типичные ошибки при устранении
Закрыли всё подряд. В попытке избавиться от дублей закрывают весь каталог с фильтрами и теряют половину трафика.
Одновременно запрет обхода и указание в коде. Робот не может прочитать указание на странице, которую ему запрещено обходить.
Указание основного адреса на несуществующую страницу. После перестройки структуры такое встречается часто и создаёт путаницу.
Указание основного адреса на главную со всех страниц. Распространённая ошибка при неаккуратной настройке модуля: в поиске остаётся одна страница вместо сотни.
Цепочки переадресаций. Один адрес ведёт на второй, второй на третий, третий на четвёртый. Каждый шаг замедляет загрузку и размывает значимость. Переадресация должна быть одношаговой.
Временная переадресация вместо постоянной. Она не передаёт значимость и не объединяет адреса.
Забыли про внутренние ссылки. Настроили переадресацию, но по сайту продолжают идти ссылки на старые адреса. Формально работает, но робот тратит обход впустую.
Ждут результата через неделю. Переоценка занимает от двух недель до двух месяцев в зависимости от размера сайта.
Как не создавать дубли впредь
Одна страница — один адрес. Простое правило, которое проверяется при любой доработке.
Проверяйте после каждого обновления. Установка нового модуля, смена шаблона, изменение структуры каталога — повод заново проверить, не появились ли новые схемы адресов.
Не запускайте страницы без заполненных заголовков и описаний. Одинаковые шаблонные значения — прямой путь к тому, что страницы будут признаны дублями.
Тестовые копии всегда закрывайте. И проверяйте это отдельным пунктом при сдаче работ.
Следите за уведомлениями Вебмастера. Резкий рост исключённых страниц — сигнал, что где-то прорвало.
Раз в квартал проверяйте количество страниц. Расхождение между реальным числом страниц и найденным роботом — самый простой индикатор.
Итог
Дубли — техническая проблема с прямыми последствиями для продаж: поиск показывает не те страницы, позиции скачут, новые страницы долго не попадают в выдачу, а сайт получает оценку как содержащий много малополезного.
Основные источники предсказуемы: варианты адреса главной, слэш и приставка, параметры сортировки и меток, фильтры каталога, пагинация, забытые тестовые копии. Инструменты тоже понятны: постоянная переадресация там, где возможно, указание основного адреса там, где страница должна оставаться доступной, директива незначащих параметров для меток и сортировок, запрет индексации для служебных разделов и уникализация там, где страницы должны различаться по существу.
Главное — не действовать вслепую. Неаккуратное закрытие может убрать из поиска нужные страницы, и обнаружится это через месяц по падению трафика.
Если в Вебмастере растёт число исключённых страниц, а количество адресов на сайте в разы превышает количество реального содержимого, стоит провести технический аудит. Специалисты компании «Сайты Профессионально» найдут все схемы образования дублей на вашем сайте, определят, что закрывать, а что открывать, аккуратно настроят переадресацию и служебные указания, приведут в порядок внутренние ссылки и карту сайта, а затем проследят динамику в Вебмастере. Позвоните или напишите нам — проверим сайт и назовём объём работ бесплатно.
