Нагрузка от роботов нейропоиска и сервисов-сканеров: как отличать и что настраивать

Владелец сайта смотрит статистику посещаемости и видит странное: по данным хостинга обращений к сайту в несколько раз больше, чем показывает Яндекс.Метрика. Сервер периодически подтормаживает, хотя реальных посетителей немного. В журналах сервера — сотни тысяч запросов от программ, названия которых ни о чём не говорят.
Это роботы. Их стало заметно больше за последние пару лет, и значительная часть новых — это сборщики данных для нейросетей и генеративных поисковых систем. Разбираться с ними приходится аккуратно: часть роботов нужно ограничивать, а часть, наоборот, критически важна для того, чтобы вас находили.
Разберём, кто ходит по вашему сайту, как их различать, кого пускать и как снизить нагрузку, не отрезав себя от источников обращений.
Кто ходит по сайту
Всех автоматических посетителей можно разделить на несколько групп.
Роботы поисковых систем. Обходят сайт, чтобы страницы попадали в поиск. Без них вас не будет в выдаче. Ходят достаточно вежливо: соблюдают ограничения, не создают запредельной нагрузки, реагируют на настройки скорости обхода.
Роботы нейропоисковых и генеративных систем. Новая и быстро растущая категория. Собирают содержимое сайтов, чтобы отвечать на вопросы пользователей и ссылаться на источники. Часть из них — те же поисковые роботы, работающие в новом качестве, часть — отдельные программы. Их поведение разное: некоторые аккуратны, некоторые обходят сайт очень интенсивно.
Сборщики данных для обучения моделей. Отдельная группа. Собирают тексты не для того, чтобы показывать ссылки на вас, а для обучения. Прямой пользы вам обычно не приносят.
Сервисы аналитики и мониторинга. Проверяют доступность сайта, скорость, позиции, техническое состояние. Обычно ходят мало и по расписанию.
Парсеры конкурентов. Собирают ваши цены, ассортимент, тексты. Пользы никакой, нагрузка бывает существенной, особенно на каталогах.
Сканеры уязвимостей. Ищут дыры в защите. Ходят по типовым адресам админок и служебных файлов. Не приносят ничего, кроме риска и нагрузки.
Агрегаторы и сравнивалки цен. Забирают данные каталога. Могут быть полезны, если приводят покупателей, и вредны, если просто нагружают сервер.
Как отличить робота от человека
Несколько практических признаков.
Смотрите журналы сервера, а не Метрику. Счётчик аналитики выполняется скриптом в браузере, и большинство роботов его не запускают. Поэтому в Метрике роботов почти не видно, а в журналах сервера видно всё. Расхождение между этими двумя источниками и есть автоматический трафик.
Идентификатор программы. В каждом запросе передаётся строка, в которой программа представляется. У поисковых роботов там понятные названия, у сборщиков нейросетей — тоже обычно узнаваемые. Проблема в том, что этому полю нельзя доверять: недобросовестные парсеры маскируются под обычные браузеры.
Поведение. Человек открывает несколько страниц с паузами, загружает картинки и стили, двигает мышью. Робот запрашивает много страниц подряд с равными интервалами, часто не грузит изображения и оформление, ходит по адресам, на которые нет ссылок с сайта.
Скорость. Десятки запросов в секунду с одного адреса — точно не человек.
Адрес источника. У крупных систем есть официальные диапазоны адресов, и подлинность робота можно проверить обратным запросом к системе доменных имён. Это единственный надёжный способ отличить настоящего поискового робота от маскирующегося парсера.
Что запрашивают. Обращения к служебным адресам, попытки открыть файлы конфигурации, перебор вариантов входа в админку — это сканеры уязвимостей.
Как понять, что нагрузка от роботов стала проблемой
Не всякая роботная активность вредна. Признаки того, что пора вмешаться:
- сервер периодически отвечает медленно или отдаёт ошибки, а реальных посетителей мало
- хостинг присылает предупреждения о превышении лимитов
- в журналах видно, что один источник запрашивает тысячи страниц в час
- нагрузка на базу данных растёт, хотя ничего не менялось
- сайт «тормозит» в определённые часы регулярно
- резко вырос расход трафика.
Если ничего из этого нет, а роботы просто ходят — вмешиваться не нужно. Лишние ограничения приносят больше вреда, чем пользы.
Что настраивать: по возрастанию жёсткости
Уровень 1. Файл с правилами для роботов
Первый и главный инструмент. Текстовый файл в корне сайта, где указано, какие разделы можно обходить, а какие нет.
Что стоит закрыть от обхода всем роботам:
- админку и служебные разделы
- страницы результатов поиска по сайту
- страницы корзины и оформления заказа
- личный кабинет
- страницы с параметрами сортировки и постраничной навигации, если они порождают бесконечное количество вариантов
- технические файлы.
Именно бесконечные комбинации фильтров и сортировок в каталоге — главный источник роботной нагрузки на интернет-магазинах. Робот может генерировать миллионы адресов, обходя один и тот же товар в разных сочетаниях параметров.
Отдельно в этом файле можно задать интервал между запросами для конкретных роботов — это снижает нагрузку, не запрещая обход.
Важное предупреждение. Правила в этом файле — рекомендация. Добросовестные роботы их соблюдают, недобросовестные игнорируют. Поэтому файл решает задачу только частично.
Уровень 2. Настройка скорости обхода в панелях для вебмастеров
У поисковых систем есть инструменты для владельцев сайтов, где можно указать желаемую скорость обхода. В Яндекс.Вебмастере такая настройка есть, и если поисковый робот создаёт заметную нагрузку, её стоит уменьшить.
Осторожно: слишком низкая скорость обхода означает, что новые страницы будут попадать в поиск медленнее.
Уровень 3. Ограничение частоты запросов на уровне сервера
Настройка, при которой с одного адреса разрешено не более определённого количества запросов в единицу времени. Превысившим — временная блокировка или замедление.
Это универсальный механизм: он работает против всех, независимо от того, как программа себя называет. Настраивается на уровне веб-сервера.
Важно подобрать разумный порог: слишком строгий будет мешать реальным посетителям, особенно тем, кто сидит за общим адресом организации.
Уровень 4. Блокировка по адресу или по идентификатору
Точечная мера против конкретных нарушителей. Если в журналах видно, что один источник систематически создаёт нагрузку и не приносит пользы, его можно заблокировать.
Здесь нужна аккуратность: блокировка по идентификатору программы легко обходится, а блокировка по адресу может задеть невиновных, если адрес общий.
Уровень 5. Защита от автоматических запросов
Специализированные средства, отличающие людей от программ по поведению. Оправданы для крупных сайтов с серьёзной проблемой парсинга. Для большинства компаний избыточны.
Отдельно: роботы нейропоиска — пускать или нет
Это новый вопрос, и ответ на него не такой очевидный, как кажется.
Аргументы за то, чтобы пускать. Всё больше людей задают вопросы не в виде запроса из двух слов, а целиком: «кто в таком-то городе делает такую-то услугу и сколько это стоит». Генеративная система формирует ответ и ссылается на источники. Если ваш сайт закрыт от обхода, вас в этом ответе не будет — сошлются на конкурента. Для растущей доли аудитории это уже основной способ находить подрядчиков.
Аргументы против. Часть систем собирает содержимое исключительно для обучения моделей, не давая ссылок и не приводя посетителей. Плюс интенсивный обход создаёт нагрузку.
Практический подход, который мы рекомендуем. Различайте два типа роботов.
Тех, кто индексирует сайт для ответов со ссылками на источник, — пускать обязательно. Это ваш канал обращений, и закрывать его — то же самое, что закрыться от обычного поиска.
Тех, кто собирает данные только для обучения без обратных ссылок, — можно ограничивать, если они создают заметную нагрузку. Но если нагрузки нет, особого смысла в блокировке тоже нет.
Главное — не рубить сгоряча. Мы видели случаи, когда системный администратор, борясь с нагрузкой, закрывал сайт от всех роботов подряд, включая поисковые. Результат обнаруживался через месяц, когда обваливался поток посетителей и обращений, а восстановление занимало ещё несколько месяцев.
Что проверить прямо сейчас: откройте файл с правилами для роботов и убедитесь, что в нём нет запрета на обход всего сайта. Это одна строка, которую легко случайно оставить после переноса с тестового сервера, и она стоит очень дорого.
Как снизить нагрузку без блокировок
Часто правильнее не блокировать, а сделать так, чтобы обход был дешевле для сервера.
Кэширование. Готовые страницы отдаются из кэша, без обращения к базе данных. Это самое эффективное средство: нагрузка от роботов падает в разы, а вы никого не блокируете.
Сокращение бесконечных адресов. Закройте от обхода комбинации фильтров, оставив открытыми только осмысленные страницы. Это резко сокращает объём работы для роботов.
Оптимизация тяжёлых страниц. Если какая-то страница выполняется по несколько секунд, именно она и создаёт основную нагрузку при массовом обходе. Найти такие страницы можно по журналам.
Корректная карта сайта. Актуальная карта помогает роботам обходить нужное, не перебирая всё подряд.
Правильные ответы сервера. Если страница удалена, сервер должен отвечать соответствующим кодом, а не отдавать страницу с ошибкой в обычном виде. Иначе роботы будут ходить по несуществующим адресам бесконечно.
Заголовки о времени изменения. Позволяют роботу не перезагружать страницу, которая не менялась. Экономит очень много ресурсов.
Более мощный сервер. Иногда самое простое решение. Если сайт вырос, а хостинг остался тем же, что пять лет назад, проблема не в роботах.
Как это связано с продвижением «три в одном»
Работа с роботами напрямую влияет на все три канала обращений — и ошибки здесь обходятся дорого.
Поиск и нейропоиск. Здесь связь прямая. Закрыли робота — исчезли из выдачи или из генеративных ответов. Перегрузили сервер — робот получает ошибки, снижает скорость обхода, новые страницы попадают в поиск медленно. Отдельно важно: чтобы вас цитировали в генеративных ответах, содержимое должно быть доступно роботу в виде обычного текста в исходном коде страницы. Если ключевые факты о компании подгружаются скриптом уже после открытия страницы, робот их не увидит — как бы хорошо они ни выглядели у посетителя.
Карточка в Яндекс Бизнесе. От нагрузки на ваш сервер не зависит совсем — карточка живёт на стороне сервиса. Это ещё один довод в пользу нескольких точек входа: пока сайт медленно отвечает под нагрузкой, обращения продолжают идти с карт. Но есть косвенная связь: если ссылка из карточки ведёт на медленно открывающийся сайт, часть людей уйдёт.
2ГИС. То же самое. Карточка работает независимо, и это ваша страховка.
Практический вывод: не стоит строить весь поток обращений на одном канале, который зависит от технического состояния сервера. И оценивать последствия любых технических работ нужно по числу обращений из всех источников, а не по видимости сайта — она персонализирована и о результате не говорит ничего.
Порядок действий, если подозреваете проблему
- Запросите у хостинга журналы сервера за последнюю неделю или откройте их сами, если есть доступ.
- Посчитайте, сколько запросов и с каких источников. Обычно достаточно посмотреть на десятку самых активных.
- Сравните с данными Яндекс.Метрики. Разница — это роботы.
- Определите, кто именно нагружает. Проверьте подлинность крупных роботов, чтобы не заблокировать настоящего поискового.
- Посмотрите, что они запрашивают. Если это бесконечные комбинации фильтров — проблема в структуре адресов, а не в роботах.
- Включите кэширование, если его нет. Часто на этом всё и заканчивается.
- Закройте в файле для роботов служебные разделы и бесконечные комбинации параметров.
- Настройте ограничение частоты запросов на уровне сервера.
- Точечно заблокируйте явных нарушителей, которые не приносят пользы.
- Проверьте через неделю, что нагрузка снизилась, а поток посетителей из поиска не упал.
Последний пункт обязателен. Любые ограничения нужно проверять по результату, иначе легко решить одну проблему и создать другую, гораздо более дорогую.
Чего делать не стоит
Закрывать сайт от всех роботов. Это отрезает вас от поиска и от генеративных ответов.
Блокировать без разбора по идентификатору программы. Легко обходится и легко задевает нужных.
Ставить жёсткие ограничения частоты запросов. Пострадают посетители из организаций с общим выходом в сеть.
Игнорировать проблему. Медленный сайт теряет обращения, даже если торможение вызвано роботами, а не людьми.
Решать это самостоятельно без понимания. Одна лишняя строка в файле для роботов может стоить месяцев восстановления.
Итог
Роботов на сайтах стало заметно больше, и их состав изменился: к поисковым добавились сборщики для нейропоисковых систем. Часть из них — важный источник обращений, часть — просто нагрузка. Разбираться нужно аккуратно: сначала посмотреть журналы и понять, кто и что запрашивает, потом включить кэширование и закрыть служебные разделы, и только потом — точечные ограничения. И обязательно проверить результат через неделю, убедившись, что поток посетителей и обращений не упал.
Главное — не закрыться от тех, благодаря кому вас находят. В попытке снизить нагрузку легко отрезать себя от поиска и от генеративных ответов, а обнаружить это через месяц по обвалу заявок.
Если сервер под нагрузкой, а разбираться в журналах некому, — это как раз задача для специалистов по сопровождению. Компания «Сайты Профессионально» девятнадцать лет обслуживает сайты и серверы. Мы бесплатно посмотрим, что происходит с вашим сайтом: кто его обходит, какая доля нагрузки от роботов, не закрыты ли вы случайно от поиска и что можно настроить, чтобы сайт работал быстро без потери обращений. Напишите нам — разбор бесплатный.
Хотите получить бесплатную диагностику сайта?
Получите бесплатную экспресс-диагностику за 24 часа. Проверим ошибки, сбои, скорость, безопасность и скрытые ошибки — пришлём отчёт с рекомендациями.
- Скорость загрузки и мобильная версия
- Уязвимости, вирусы, взломы
- Битые ссылки, дубли, SEO-ошибки
- Статус домена, SSL, хостинга
Популярные решения наших клиентов:

До 10 часов работ в мес.
Ежедневная диагностика
Продление домена
Продление хостинга/сервера

До 40 часов работ в мес.

До 100 часов работ в мес.
