PRLab → SEO-блог
Disallow: как правильно закрывать страницы в robots.txt
Директива Disallow управляет обходом сайта роботами. Она экономит краулинговый бюджет на поиске, корзине и технических URL, но одна неверная строка способна закрыть полезные страницы. Разберём безопасный подход: что запрещать, как проверить результат и в каких случаях robots.txt вообще не подходит.

Что делает Disallow и чего от него не стоит ждать
robots.txt — текстовый файл в корне сайта, например https://site.ru/robots.txt. В блоке сначала называют робота через User-agent, а затем перечисляют пути. Запись Disallow: /admin/ просит краулер не скачивать все URL, начинающиеся с /admin/. Так удобно исключать разделы, которые не дают поисковой ценности, порождают множество служебных адресов или создают лишнюю нагрузку.
Главное ограничение: запрет обхода не гарантирует исчезновение URL из поиска. Google отдельно предупреждает: закрытый robots.txt адрес всё ещё может быть найден по внешним ссылкам и попасть в выдачу без полного содержимого. Если страницу нужно убрать из индекса, но оставить доступной роботу, используйте noindex. Если нужно скрыть личные данные, применяйте авторизацию, 401/403 и ограничения на сервере. Робот не прочитает meta robots внутри страницы, которую вы уже закрыли от обхода.
Частые кандидаты на закрытие: результаты внутреннего поиска, корзина, оформление заказа, личный кабинет, тестовые папки, служебные действия и бесконечные комбинации фильтров. Но готовый список нельзя копировать вслепую. Например, закрыв /catalog/, магазин легко лишается обхода категорий и карточек товара.
Синтаксис: путь, слеш, маска и исключение
В Disallow указывают путь после домена. Начальный слеш важен: Disallow: /search/ относится к разделу сайта. Пустая строка Disallow: ничего не запрещает. Комментарий начинается со знака #. Яндекс и Google понимают * как любую последовательность символов, а $ — как конец адреса. Чем сложнее маска, тем обязательнее тест на реальных URL.
| Правило | Как читается | Когда уместно |
|---|---|---|
Disallow: /admin/ | Не обходить папку и вложенные URL. | Админ-панель, кабинет, тестовый раздел. |
Disallow: /search/ | Не обходить внутренний поиск. | Поисковая выдача создаёт малоценные URL. |
Disallow: /*?sort= | Не обходить сортировки с параметром. | После проверки всех SEO-посадочных. |
Disallow: /*.pdf$ | Не обходить URL, оканчивающиеся на PDF. | Только если документы не нужны в поиске. |
Allow: /catalog/guide/ | Исключение из общего запрета. | Полезный подраздел внутри закрытого пути. |
При пересечении правил важна конкретность: более длинное совпадение обычно выигрывает. Яндекс указывает, что при равной длине конфликтующих правил предпочтение получает Allow. Поэтому не плодите пересекающиеся маски и проверяйте исключения. Связка Disallow: /catalog/ и Allow: /catalog/guide/ допустима, но должна быть подтверждена на всех важных URL.
User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /account/
Allow: /catalog/guide/
Sitemap: https://example.com/sitemap.xmlКакие страницы закрывать: примеры и подсказки
Начинайте не с чужого robots.txt, а с карты URL. Выгрузите страницы из краулера, посмотрите отчёты индексирования и серверные логи. Найдите группы, которые возникают автоматически: поиск, сортировки, сессии, печатные версии, технические действия. Для каждой группы спросите: нужна ли она человеку из поиска? Если нет, требуется ли роботу увидеть на ней canonical или noindex? Ответ определяет инструмент.
| Тип URL | Обычное решение | Риск |
|---|---|---|
| Внутренний поиск | Disallow: /search/ | Проверьте, что полезные посадочные не используют этот путь. |
| Корзина и checkout | Disallow + защита сессии | Не блокируйте соседние страницы товара. |
| Фильтры каталога | Выборочно: canonical, noindex или Disallow | Глобальная маска параметров закроет ценные посадочные. |
| PDF-инструкции | Оставить открытыми либо Disallow | Документы могут приводить целевой трафик. |
| Личный кабинет | Авторизация; при необходимости Disallow | Robots.txt сам по себе не скрывает данные. |
Если файл нужно собрать с нуля, используйте AI‑генератор robots.txt PRLab. Он подготовит консервативную основу; затем обязательно сопоставьте каждую строку со структурой именно вашего сайта.
Disallow, noindex, canonical и авторизация: что выбрать
Эти механизмы решают разные задачи. Неподходящий выбор приводит к знакомой ситуации: страницу «закрыли», а она всё ещё показывается в выдаче, либо робот не видит canonical и продолжает учитывать дубли.
| Задача | Подход | Видит ли робот URL? | Результат |
|---|---|---|---|
| Снизить нагрузку от обхода | Disallow | Нет, если правило соблюдается. | Краулер не скачивает заданный путь. |
| Убрать доступную страницу из поиска | noindex в meta или X-Robots-Tag | Да. | URL исключается после обработки. |
| Объединить дубли | rel=canonical | Да. | Указывается предпочитаемая версия. |
| Скрыть приватные данные | Авторизация, 401/403 | Нет без доступа. | Контент не выдаётся посторонним. |
| Убрать URL навсегда | 404/410 или 301 на замену | Да. | Поисковик получает корректный сигнал. |
Особенно опасно одновременно ставить Disallow и noindex. Чтобы прочитать мета-тег или HTTP-заголовок, робот должен открыть страницу. Сначала дайте ему обработать noindex и дождитесь исключения URL, а только затем, если нужно экономить обход, добавляйте запрет.
Пять ошибок и чек-лист перед публикацией
Первая ошибка — Disallow: / в общем блоке. Она закрывает весь сайт и допустима лишь на временном стенде. Вторая — считать robots.txt паролем. Файл публичен. Третья — забыть границы правила. Проверьте, затрагивает ли маска именно нужную группу URL. Четвёртая — закрыть CSS, JavaScript и изображения без причины. Роботу могут понадобиться ресурсы для рендеринга. Пятая — не проверить ответ файла. robots.txt должен находиться в корне домена и возвращать HTTP 200.
- Сохраните текущий robots.txt и список URL, которые обязаны остаться доступны.
- Для каждого Disallow запишите причину: дубли, поиск, служебная функция или нагрузка.
- Проверьте правила на главной, категориях, карточках, статьях, пагинации и sitemap.xml.
- Не блокируйте URL с noindex, пока робот не успел увидеть этот сигнал.
- После публикации наблюдайте за отчётами обхода и индексации, а не только за текстом файла.
Грамотный robots.txt — не длинный перечень запретов, а точная карта того, куда роботу идти не нужно. Чем яснее структура URL и цель каждой директивы, тем меньше риск потерять органический трафик из-за одной строки.