Robots.txt: что это и как файл влияет на индексацию сайта
Robots.txt — служебный текстовый файл, в котором задаются правила доступа поисковых программ к разделам сайта. С его помощью можно ограничить сканирование административной панели, внутреннего поиска, корзины, технических параметров и других адресов страниц (URL), которые не должны расходовать ресурсы поисковых роботов.
Главная функция файла — управление обходом. Он не оценивает качество контента, не повышает позиции и не гарантирует удаление адреса из поисковой выдачи. Если закрытая страница уже известна Яндексу или Google по внешним и внутренним ссылкам, её адрес страницы может продолжать отображаться без полноценного описания.
Поэтому перед настройкой важно определить задачу: сократить обход технических адресов, исключить документ из результатов, выбрать основную версию дубля или закрыть конфиденциальную информацию. Для этих целей используются разные инструменты.
Что такое robots.txt
Robots.txt — файл в формате TXT, который размещается в корне домена. Для условного сайта example.ru он должен открываться по адресу:
Перед загрузкой страниц поисковый робот обращается к этому адресу и проверяет правила, относящиеся к его имени. Владелец ресурса может подготовить общий блок для всех краулеров или создать отдельные настройки для Yandex, Googlebot и других агентов.
Документ работает в рамках протокола исключений для роботов. Добросовестные поисковые системы учитывают указанные требования, но произвольный автоматический сканер может их проигнорировать.
По этой причине robots.txt нельзя использовать для защиты персональных данных, административных документов и закрытых файлов. Его содержимое общедоступно: любой пользователь может открыть адрес и увидеть перечисленные каталоги. Для конфиденциальных разделов нужны авторизация, пароль или серверное ограничение доступа.
Для чего нужен файл
На небольшом корпоративном ресурсе может быть несколько десятков страниц. В интернет-магазине, каталоге или портале система управления способна автоматически создавать тысячи дополнительных URL.
Они появляются из-за:
-
фильтров;
-
сортировок;
-
пагинации;
-
результатов внутреннего поиска;
-
параметров и рекламных меток;
-
сравнения товаров;
-
личных кабинетов;
-
технических сценариев.
Не все такие адреса полезны для поисковой выдачи. Одни полностью повторяют основной материал, другие содержат минимальные отличия или не представляют ценности для посетителя.
Корректные правила помогают уменьшить количество ненужных запросов к серверу и не направлять роботов в многочисленные сочетания параметров. Для крупных проектов это позволяет рациональнее использовать ресурс обхода.
При этом нельзя закрывать все пути, которые выглядят техническими. Среди них могут находиться важные изображения, файлы оформления, скрипты, посадочные страницы и полезные комбинации фильтров. Сначала проводится анализ структуры, после чего формируются ограничения.
Как проходит обход сайта
Поисковая система узнаёт о новых узнаёт о новых адресах страниц (URL) из XML-карты, внутренних и внешних ссылок, перенаправлений и ранее просканированных документов.
Дальнейший процесс выглядит так:
-
Краулер обнаруживает адрес.
-
Проверяет правила для своего User-agent.
-
При разрешённом доступе отправляет запрос серверу.
-
Загружает HTML-код и подключённые ресурсы.
-
Анализирует содержание и технические сигналы.
-
Сравнивает документ с похожими версиями.
-
Решает, следует ли включать его в индекс.
-
Возвращается позднее для проверки обновлений.
Если для пути установлен Disallow (запрет на сканирование), содержимое обычно не загружается. Однако сам URL может оставаться известным благодаря ссылкам с других страниц.
Поэтому утверждение «закрыли в robots.txt — значит удалили из поиска» неверно. Файл ограничивает сканирование, но не всегда исключает адрес из базы.
Обход и индексация: в чём разница
Обход — посещение URL и получение размещённой на нём информации. Индексация — следующий этап, на котором поисковая система обрабатывает данные и решает, может ли документ участвовать в выдаче.
| Этап | Что происходит |
| Обнаружение | Поисковик узнаёт о существовании URL |
| Обход | Робот запрашивает страницу |
| Анализ | Изучаются содержание и технические сигналы |
| Индексация | Документ может быть добавлен в базу |
| Ранжирование | Определяется позиция по запросу |
Разница важна при использовании noindex. Эта команда размещается в HTML-коде или передаётся через HTTP-заголовок. Чтобы обнаружить её, поисковому роботу необходимо загрузить документ.
Если одновременно запретить обход через robots.txt, краулер может не увидеть установленное правило. Поэтому нельзя автоматически объединять Disallow и noindex.
Перед настройкой определяют цель:
-
сократить сканирование ненужных URL;
-
убрать документ из результатов;
-
объединить дубли;
-
перенаправить посетителей;
-
закрыть данные от посторонних.
Для каждой задачи применяется отдельный механизм.
Где размещается robots.txt
Файл должен находиться непосредственно в корне домена:
Размещение внутри каталога не распространяет правила на весь сайт:
https://example.ru/catalog/robots.txt
Для каждого поддомена нужен отдельный документ:
https://example.ru/robots.txt
https://shop.example.ru/robots.txt
https://blog.example.ru/robots.txt
Корректный файл:
-
имеет точное имя robots.txt;
-
доступен без авторизации;
-
возвращает код 200 OK;
-
содержит обычный текст;
-
соответствует текущей структуре;
-
не перенаправляет на HTML-страницу.
После перехода с HTTP на HTTPS, переноса сайта или смены CMS необходимо повторно проверить его доступность и содержание.
Основные директивы
1. User-agent
Директива определяет, какой робот должен выполнять расположенные ниже правила:
User-agent: *
Символ * означает всех агентов, поддерживающих протокол.
Для отдельной системы можно создать собственный блок:
User-agent: Yandex
User-agent: Googlebot
2. Disallow
Disallow ограничивает сканирование указанного пути:
User-agent: *
Disallow: /admin/
В этом примере закрывается административный каталог и вложенные в него адреса.
Наиболее опасное правило:
User-agent: *
Disallow: /
Оно запрещает обход всего сайта. Такая запись может использоваться на тестовой площадке, но перед публикацией проекта её необходимо удалить.
Пустая строка не создаёт запрета:
Disallow:
3. Allow
Allow открывает отдельный путь внутри закрытого раздела:
User-agent: *
Disallow: /filter/
Allow: /filter/useful-page/
При пересечении правил учитывается наиболее точное соответствие проверяемому адресу. Поэтому результат следует тестировать на конкретных URL.
4. Sitemap
Директива указывает полный адрес XML-карты:
Sitemap: https://example.ru/sitemap.xml
Если карт несколько, каждая добавляется отдельной строкой:
Sitemap: https://example.ru/sitemap-pages.xml
Sitemap: https://example.ru/sitemap-products.xml
Sitemap помогает поисковым системам находить важные и обновлённые материалы, но не гарантирует их индексацию. В карту не следует добавлять закрытые адреса и страницы с ошибками.
5. Clean-param
Директива применяется Яндексом для обработки параметров, которые не меняют полезное содержание страницы. Например, рекламные метки могут создавать разные варианты одного URL.
Использовать Clean-param нужно после анализа логики параметров. Ошибка способна объединить документы с различным содержанием.
Google не применяет эту директиву как стандартный способ обработки адресов. Для него проблему решают через структуру сайта, внутренние ссылки, canonical и настройки CMS.
6. Символы * и $
Звёздочка заменяет произвольную последовательность символов:
Disallow: /*?sort=
Знак $ обозначает окончание адреса:
Disallow: /*.pdf$
Шаблонные правила позволяют ограничить группу URL, но требуют тестирования. Слишком широкая маска может закрыть полезные коммерческие или информационные страницы.
Какие адреса можно закрывать
Чаще всего анализируют:
-
административную панель;
-
внутренний поиск;
-
корзину;
-
этапы оформления заказа;
-
личный кабинет;
-
авторизацию;
-
избранное;
-
сравнение товаров;
-
технические сценарии;
-
временные копии;
-
параметры сортировки;
-
пустые сочетания фильтров;
-
тестовые разделы.
Перед закрытием необходимо проверить:
-
Есть ли на странице самостоятельное содержание.
-
Может ли она отвечать на поисковый запрос.
-
Присутствуют ли внутренние ссылки.
-
Добавлен ли адрес в Sitemap.
-
Какой код возвращает сервер.
-
Указана ли каноническая версия.
-
Используется ли путь для загрузки интерфейса.
CSS, JavaScript и изображения нельзя блокировать автоматически. Если они необходимы для отображения меню, мобильной версии или основного контента, запрет способен помешать корректному анализу страницы.
Отличия от noindex, canonical и Sitemap
Инструменты решают разные задачи.
| Инструмент | Назначение |
| Robots.txt | Управляет доступом краулеров к URL |
| Noindex | Запрещает показ документа в выдаче |
| X-Robots-Tag | Передаёт правило через HTTP-заголовок |
| Sitemap.xml | Сообщает о важных адресах |
| Canonical | Указывает предпочтительную версию |
| Редирект 301 | Постоянно переводит на новый URL |
| Код 404 | Сообщает об отсутствии страницы |
| Код 410 | Подтверждает окончательное удаление |
Noindex — запрет индексации, подходит для страницы, доступной посетителям, но не предназначенной для поиска. При этом робот должен иметь возможность прочитать HTML-код.
X-Robots-Tag применяется для PDF и других файлов, где нельзя разместить обычный метатег.
Canonical — указание основной версии страницы, используют для похожих версий, которые необходимо сохранить. Он указывает предпочтительный URL, но не является безусловным запретом.
Если документ удалён, сервер должен вернуть код 404 или 410. При окончательной смене адреса устанавливается перенаправление 301.
Частые ошибки
Полное закрытие проекта
Оставленный после разработки Disallow: / способен остановить обход всех важных разделов.
Слишком широкое правило
Запрет каталога по одному совпадению иногда затрагивает услуги, товары или статьи с похожей частью URL.
Блокировка ресурсов
Закрытые стили и сценарии могут помешать правильному отображению страницы для поисковой системы.
Сочетание Disallow и noindex
Если обход запрещён, робот не сможет прочитать метатег и получить команду об исключении из выдачи.
Противоречие с XML-картой
Sitemap предлагает посетить адрес, а robots.txt одновременно запрещает к нему доступ.
Попытка защитить данные
Список путей остаётся общедоступным. Для приватной информации требуется серверная защита.
Копирование чужого файла
Структура URL и настройки CMS различаются. Чужой шаблон может закрыть важные разделы или оставить доступными дубли.
Устаревшие правила
После редизайна, переноса или изменения структуры старые директивы могут начать ограничивать новые страницы.
Как проверить настройки
Проверку выполняют до запуска и после каждой технической доработки.
-
Откройте /robots.txt и убедитесь, что отображается текстовый файл.
-
Проверьте ответ сервера — рабочая версия должна возвращать 200 OK.
-
Убедитесь в отсутствии случайного Disallow: /.
-
Подготовьте контрольные адреса: главную, услугу, категорию, товар, статью и URL с параметром.
-
Сопоставьте ограничения с XML-картой.
-
Проверьте доступность CSS, JavaScript и изображений.
-
Используйте анализатор Яндекс Вебмастера и инструмент проверки URL Google.
-
После изменений контролируйте индексирование и поисковый трафик.
Изменения обрабатываются не моментально. Поисковой системе необходимо повторно получить файл и пересканировать затронутые разделы.
Robots.txt — небольшой по объёму, но ответственный элемент технической оптимизации. Он помогает управлять обходом и ограничивать сканирование служебных адресов, однако не заменяет noindex, canonical, правильные ответы сервера и средства защиты данных.
Перед составлением правил необходимо изучить структуру проекта, определить типы URL, найти дубли и проверить взаимосвязь с XML-картой. После внедрения каждый важный адрес тестируется отдельно.
В STUDIO 512 можно заказать технический аудит поисковой оптимизации сайта (SEO-аудит), проверку индексации и исправление ошибок, мешающих Яндексу и Google корректно обрабатывать сайт. При создании нового проекта требования к файлу robots.txt, XML-карте сайта, структуре адресов и каноническим страницам лучше предусмотреть в рамках разработки сайта с учётом поисковой оптимизации (SEO).
