Disallow в robots.txt: как правильно закрывать страницыЯндекс, Google, Bing · топ-100

PRLab → SEO-блог

Disallow: как правильно закрывать страницы в robots.txt

Директива Disallow управляет обходом сайта роботами. Она экономит краулинговый бюджет на поиске, корзине и технических URL, но одна неверная строка способна закрыть полезные страницы. Разберём безопасный подход: что запрещать, как проверить результат и в каких случаях robots.txt вообще не подходит.

Настройка директив Disallow и Allow в robots.txt
Disallow задаёт правила обхода, а не заменяет защиту данных или удаление URL из поиска.

Что делает Disallow и чего от него не стоит ждать

robots.txt — текстовый файл в корне сайта, например https://site.ru/robots.txt. В блоке сначала называют робота через User-agent, а затем перечисляют пути. Запись Disallow: /admin/ просит краулер не скачивать все URL, начинающиеся с /admin/. Так удобно исключать разделы, которые не дают поисковой ценности, порождают множество служебных адресов или создают лишнюю нагрузку.

Главное ограничение: запрет обхода не гарантирует исчезновение URL из поиска. Google отдельно предупреждает: закрытый robots.txt адрес всё ещё может быть найден по внешним ссылкам и попасть в выдачу без полного содержимого. Если страницу нужно убрать из индекса, но оставить доступной роботу, используйте noindex. Если нужно скрыть личные данные, применяйте авторизацию, 401/403 и ограничения на сервере. Робот не прочитает meta robots внутри страницы, которую вы уже закрыли от обхода.

Частые кандидаты на закрытие: результаты внутреннего поиска, корзина, оформление заказа, личный кабинет, тестовые папки, служебные действия и бесконечные комбинации фильтров. Но готовый список нельзя копировать вслепую. Например, закрыв /catalog/, магазин легко лишается обхода категорий и карточек товара.

Синтаксис: путь, слеш, маска и исключение

В Disallow указывают путь после домена. Начальный слеш важен: Disallow: /search/ относится к разделу сайта. Пустая строка Disallow: ничего не запрещает. Комментарий начинается со знака #. Яндекс и Google понимают * как любую последовательность символов, а $ — как конец адреса. Чем сложнее маска, тем обязательнее тест на реальных URL.

ПравилоКак читаетсяКогда уместно
Disallow: /admin/Не обходить папку и вложенные URL.Админ-панель, кабинет, тестовый раздел.
Disallow: /search/Не обходить внутренний поиск.Поисковая выдача создаёт малоценные URL.
Disallow: /*?sort=Не обходить сортировки с параметром.После проверки всех SEO-посадочных.
Disallow: /*.pdf$Не обходить URL, оканчивающиеся на PDF.Только если документы не нужны в поиске.
Allow: /catalog/guide/Исключение из общего запрета.Полезный подраздел внутри закрытого пути.

При пересечении правил важна конкретность: более длинное совпадение обычно выигрывает. Яндекс указывает, что при равной длине конфликтующих правил предпочтение получает Allow. Поэтому не плодите пересекающиеся маски и проверяйте исключения. Связка Disallow: /catalog/ и Allow: /catalog/guide/ допустима, но должна быть подтверждена на всех важных URL.

User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /account/
Allow: /catalog/guide/
Sitemap: https://example.com/sitemap.xml

Какие страницы закрывать: примеры и подсказки

Начинайте не с чужого robots.txt, а с карты URL. Выгрузите страницы из краулера, посмотрите отчёты индексирования и серверные логи. Найдите группы, которые возникают автоматически: поиск, сортировки, сессии, печатные версии, технические действия. Для каждой группы спросите: нужна ли она человеку из поиска? Если нет, требуется ли роботу увидеть на ней canonical или noindex? Ответ определяет инструмент.

Тип URLОбычное решениеРиск
Внутренний поискDisallow: /search/Проверьте, что полезные посадочные не используют этот путь.
Корзина и checkoutDisallow + защита сессииНе блокируйте соседние страницы товара.
Фильтры каталогаВыборочно: canonical, noindex или DisallowГлобальная маска параметров закроет ценные посадочные.
PDF-инструкцииОставить открытыми либо DisallowДокументы могут приводить целевой трафик.
Личный кабинетАвторизация; при необходимости DisallowRobots.txt сам по себе не скрывает данные.

Если файл нужно собрать с нуля, используйте AI‑генератор robots.txt PRLab. Он подготовит консервативную основу; затем обязательно сопоставьте каждую строку со структурой именно вашего сайта.

Disallow, noindex, canonical и авторизация: что выбрать

Эти механизмы решают разные задачи. Неподходящий выбор приводит к знакомой ситуации: страницу «закрыли», а она всё ещё показывается в выдаче, либо робот не видит canonical и продолжает учитывать дубли.

ЗадачаПодходВидит ли робот URL?Результат
Снизить нагрузку от обходаDisallowНет, если правило соблюдается.Краулер не скачивает заданный путь.
Убрать доступную страницу из поискаnoindex в meta или X-Robots-TagДа.URL исключается после обработки.
Объединить дублиrel=canonicalДа.Указывается предпочитаемая версия.
Скрыть приватные данныеАвторизация, 401/403Нет без доступа.Контент не выдаётся посторонним.
Убрать URL навсегда404/410 или 301 на заменуДа.Поисковик получает корректный сигнал.

Особенно опасно одновременно ставить Disallow и noindex. Чтобы прочитать мета-тег или HTTP-заголовок, робот должен открыть страницу. Сначала дайте ему обработать noindex и дождитесь исключения URL, а только затем, если нужно экономить обход, добавляйте запрет.

Пять ошибок и чек-лист перед публикацией

Первая ошибка — Disallow: / в общем блоке. Она закрывает весь сайт и допустима лишь на временном стенде. Вторая — считать robots.txt паролем. Файл публичен. Третья — забыть границы правила. Проверьте, затрагивает ли маска именно нужную группу URL. Четвёртая — закрыть CSS, JavaScript и изображения без причины. Роботу могут понадобиться ресурсы для рендеринга. Пятая — не проверить ответ файла. robots.txt должен находиться в корне домена и возвращать HTTP 200.

  1. Сохраните текущий robots.txt и список URL, которые обязаны остаться доступны.
  2. Для каждого Disallow запишите причину: дубли, поиск, служебная функция или нагрузка.
  3. Проверьте правила на главной, категориях, карточках, статьях, пагинации и sitemap.xml.
  4. Не блокируйте URL с noindex, пока робот не успел увидеть этот сигнал.
  5. После публикации наблюдайте за отчётами обхода и индексации, а не только за текстом файла.

Грамотный robots.txt — не длинный перечень запретов, а точная карта того, куда роботу идти не нужно. Чем яснее структура URL и цель каждой директивы, тем меньше риск потерять органический трафик из-за одной строки.

Полезные источники