Robots.txt: что это и как файл влияет на индексацию сайта

Автор статьи
Алиса Ахмеджанова
alisa-akhmedzhanova
Консультация

Robots.txt — служебный текстовый файл, в котором задаются правила доступа поисковых программ к разделам сайта. С его помощью можно ограничить сканирование административной панели, внутреннего поиска, корзины, технических параметров и других адресов страниц (URL), которые не должны расходовать ресурсы поисковых роботов.

Главная функция файла — управление обходом. Он не оценивает качество контента, не повышает позиции и не гарантирует удаление адреса из поисковой выдачи. Если закрытая страница уже известна Яндексу или Google по внешним и внутренним ссылкам, её адрес страницы может продолжать отображаться без полноценного описания.

Поэтому перед настройкой важно определить задачу: сократить обход технических адресов, исключить документ из результатов, выбрать основную версию дубля или закрыть конфиденциальную информацию. Для этих целей используются разные инструменты.

Что такое robots.txt

Robots.txt — файл в формате TXT, который размещается в корне домена. Для условного сайта example.ru он должен открываться по адресу:

https://example.ru/robots.txt

Перед загрузкой страниц поисковый робот обращается к этому адресу и проверяет правила, относящиеся к его имени. Владелец ресурса может подготовить общий блок для всех краулеров или создать отдельные настройки для Yandex, Googlebot и других агентов.

Документ работает в рамках протокола исключений для роботов. Добросовестные поисковые системы учитывают указанные требования, но произвольный автоматический сканер может их проигнорировать.

По этой причине robots.txt нельзя использовать для защиты персональных данных, административных документов и закрытых файлов. Его содержимое общедоступно: любой пользователь может открыть адрес и увидеть перечисленные каталоги. Для конфиденциальных разделов нужны авторизация, пароль или серверное ограничение доступа.

Бесплатная консультация профессионалов
Если у вас есть вопросы или вы не знаете, что выбрать, оставьте свой номер — мы позвоним, чтобы ответить на все ваши вопросы.

Для чего нужен файл

На небольшом корпоративном ресурсе может быть несколько десятков страниц. В интернет-магазине, каталоге или портале система управления способна автоматически создавать тысячи дополнительных URL.

Они появляются из-за:

  • фильтров;

  • сортировок;

  • пагинации;

  • результатов внутреннего поиска;

  • параметров и рекламных меток;

  • сравнения товаров;

  • личных кабинетов;

  • технических сценариев.

Не все такие адреса полезны для поисковой выдачи. Одни полностью повторяют основной материал, другие содержат минимальные отличия или не представляют ценности для посетителя.

Корректные правила помогают уменьшить количество ненужных запросов к серверу и не направлять роботов в многочисленные сочетания параметров. Для крупных проектов это позволяет рациональнее использовать ресурс обхода.

При этом нельзя закрывать все пути, которые выглядят техническими. Среди них могут находиться важные изображения, файлы оформления, скрипты, посадочные страницы и полезные комбинации фильтров. Сначала проводится анализ структуры, после чего формируются ограничения.

Как проходит обход сайта

Поисковая система узнаёт о новых узнаёт о новых адресах страниц (URL) из XML-карты, внутренних и внешних ссылок, перенаправлений и ранее просканированных документов.

Дальнейший процесс выглядит так:

  1. Краулер обнаруживает адрес.

  2. Проверяет правила для своего User-agent.

  3. При разрешённом доступе отправляет запрос серверу.

  4. Загружает HTML-код и подключённые ресурсы.

  5. Анализирует содержание и технические сигналы.

  6. Сравнивает документ с похожими версиями.

  7. Решает, следует ли включать его в индекс.

  8. Возвращается позднее для проверки обновлений.

Если для пути установлен Disallow (запрет на сканирование), содержимое обычно не загружается. Однако сам URL может оставаться известным благодаря ссылкам с других страниц.

Поэтому утверждение «закрыли в robots.txt — значит удалили из поиска» неверно. Файл ограничивает сканирование, но не всегда исключает адрес из базы.

Обход и индексация: в чём разница

Обход — посещение URL и получение размещённой на нём информации. Индексация — следующий этап, на котором поисковая система обрабатывает данные и решает, может ли документ участвовать в выдаче.


Этап Что происходит
Обнаружение Поисковик узнаёт о существовании URL
Обход Робот запрашивает страницу
Анализ Изучаются содержание и технические сигналы
Индексация Документ может быть добавлен в базу
Ранжирование Определяется позиция по запросу

Разница важна при использовании noindex. Эта команда размещается в HTML-коде или передаётся через HTTP-заголовок. Чтобы обнаружить её, поисковому роботу необходимо загрузить документ.

Если одновременно запретить обход через robots.txt, краулер может не увидеть установленное правило. Поэтому нельзя автоматически объединять Disallow и noindex.

Перед настройкой определяют цель:

  • сократить сканирование ненужных URL;

  • убрать документ из результатов;

  • объединить дубли;

  • перенаправить посетителей;

  • закрыть данные от посторонних.

Для каждой задачи применяется отдельный механизм.


Где размещается robots.txt

Файл должен находиться непосредственно в корне домена:

https://example.ru/robots.txt

Размещение внутри каталога не распространяет правила на весь сайт:

https://example.ru/catalog/robots.txt

Для каждого поддомена нужен отдельный документ:

https://example.ru/robots.txt
https://shop.example.ru/robots.txt
https://blog.example.ru/robots.txt

Корректный файл:

  • имеет точное имя robots.txt;

  • доступен без авторизации;

  • возвращает код 200 OK;

  • содержит обычный текст;

  • соответствует текущей структуре;

  • не перенаправляет на HTML-страницу.

После перехода с HTTP на HTTPS, переноса сайта или смены CMS необходимо повторно проверить его доступность и содержание.


Основные директивы

1. User-agent

Директива определяет, какой робот должен выполнять расположенные ниже правила:

User-agent: *

Символ * означает всех агентов, поддерживающих протокол.

Для отдельной системы можно создать собственный блок:

User-agent: Yandex
User-agent: Googlebot

2. Disallow

Disallow ограничивает сканирование указанного пути:

User-agent: *
Disallow: /admin/

В этом примере закрывается административный каталог и вложенные в него адреса.

Наиболее опасное правило:

User-agent: *
Disallow: /

Оно запрещает обход всего сайта. Такая запись может использоваться на тестовой площадке, но перед публикацией проекта её необходимо удалить.

Пустая строка не создаёт запрета:

Disallow:

3. Allow

Allow открывает отдельный путь внутри закрытого раздела:

User-agent: *
Disallow: /filter/
Allow: /filter/useful-page/

При пересечении правил учитывается наиболее точное соответствие проверяемому адресу. Поэтому результат следует тестировать на конкретных URL.

4. Sitemap

Директива указывает полный адрес XML-карты:

Sitemap: https://example.ru/sitemap.xml

Если карт несколько, каждая добавляется отдельной строкой:

Sitemap: https://example.ru/sitemap-pages.xml
Sitemap: https://example.ru/sitemap-products.xml

Sitemap помогает поисковым системам находить важные и обновлённые материалы, но не гарантирует их индексацию. В карту не следует добавлять закрытые адреса и страницы с ошибками.

5. Clean-param

Директива применяется Яндексом для обработки параметров, которые не меняют полезное содержание страницы. Например, рекламные метки могут создавать разные варианты одного URL.

Использовать Clean-param нужно после анализа логики параметров. Ошибка способна объединить документы с различным содержанием.

Google не применяет эту директиву как стандартный способ обработки адресов. Для него проблему решают через структуру сайта, внутренние ссылки, canonical и настройки CMS.

6. Символы * и $

Звёздочка заменяет произвольную последовательность символов:

Disallow: /*?sort=

Знак $ обозначает окончание адреса:

Disallow: /*.pdf$

Шаблонные правила позволяют ограничить группу URL, но требуют тестирования. Слишком широкая маска может закрыть полезные коммерческие или информационные страницы.


Какие адреса можно закрывать

Чаще всего анализируют:

  • административную панель;

  • внутренний поиск;

  • корзину;

  • этапы оформления заказа;

  • личный кабинет;

  • авторизацию;

  • избранное;

  • сравнение товаров;

  • технические сценарии;

  • временные копии;

  • параметры сортировки;

  • пустые сочетания фильтров;

  • тестовые разделы.

Перед закрытием необходимо проверить:

  1. Есть ли на странице самостоятельное содержание.

  2. Может ли она отвечать на поисковый запрос.

  3. Присутствуют ли внутренние ссылки.

  4. Добавлен ли адрес в Sitemap.

  5. Какой код возвращает сервер.

  6. Указана ли каноническая версия.

  7. Используется ли путь для загрузки интерфейса.

CSS, JavaScript и изображения нельзя блокировать автоматически. Если они необходимы для отображения меню, мобильной версии или основного контента, запрет способен помешать корректному анализу страницы.

Отличия от noindex, canonical и Sitemap

Инструменты решают разные задачи.


Инструмент Назначение
Robots.txt Управляет доступом краулеров к URL
Noindex Запрещает показ документа в выдаче
X-Robots-Tag Передаёт правило через HTTP-заголовок
Sitemap.xml Сообщает о важных адресах
Canonical Указывает предпочтительную версию
Редирект 301 Постоянно переводит на новый URL
Код 404 Сообщает об отсутствии страницы
Код 410 Подтверждает окончательное удаление

Noindex — запрет индексации, подходит для страницы, доступной посетителям, но не предназначенной для поиска. При этом робот должен иметь возможность прочитать HTML-код.

X-Robots-Tag применяется для PDF и других файлов, где нельзя разместить обычный метатег.

Canonical — указание основной версии страницы, используют для похожих версий, которые необходимо сохранить. Он указывает предпочтительный URL, но не является безусловным запретом.

Если документ удалён, сервер должен вернуть код 404 или 410. При окончательной смене адреса устанавливается перенаправление 301.


Частые ошибки

Полное закрытие проекта

Оставленный после разработки Disallow: / способен остановить обход всех важных разделов.

Слишком широкое правило

Запрет каталога по одному совпадению иногда затрагивает услуги, товары или статьи с похожей частью URL.

Блокировка ресурсов

Закрытые стили и сценарии могут помешать правильному отображению страницы для поисковой системы.

Сочетание Disallow и noindex

Если обход запрещён, робот не сможет прочитать метатег и получить команду об исключении из выдачи.

Противоречие с XML-картой

Sitemap предлагает посетить адрес, а robots.txt одновременно запрещает к нему доступ.

Попытка защитить данные

Список путей остаётся общедоступным. Для приватной информации требуется серверная защита.

Копирование чужого файла

Структура URL и настройки CMS различаются. Чужой шаблон может закрыть важные разделы или оставить доступными дубли.

Устаревшие правила

После редизайна, переноса или изменения структуры старые директивы могут начать ограничивать новые страницы.

Как проверить настройки

Проверку выполняют до запуска и после каждой технической доработки.

  1. Откройте /robots.txt и убедитесь, что отображается текстовый файл.

  2. Проверьте ответ сервера — рабочая версия должна возвращать 200 OK.

  3. Убедитесь в отсутствии случайного Disallow: /.

  4. Подготовьте контрольные адреса: главную, услугу, категорию, товар, статью и URL с параметром.

  5. Сопоставьте ограничения с XML-картой.

  6. Проверьте доступность CSS, JavaScript и изображений.

  7. Используйте анализатор Яндекс Вебмастера и инструмент проверки URL Google.

  8. После изменений контролируйте индексирование и поисковый трафик.

Изменения обрабатываются не моментально. Поисковой системе необходимо повторно получить файл и пересканировать затронутые разделы.


Robots.txt — небольшой по объёму, но ответственный элемент технической оптимизации. Он помогает управлять обходом и ограничивать сканирование служебных адресов, однако не заменяет noindex, canonical, правильные ответы сервера и средства защиты данных.

Перед составлением правил необходимо изучить структуру проекта, определить типы URL, найти дубли и проверить взаимосвязь с XML-картой. После внедрения каждый важный адрес тестируется отдельно.

В STUDIO 512 можно заказать технический аудит поисковой оптимизации сайта (SEO-аудит), проверку индексации и исправление ошибок, мешающих Яндексу и Google корректно обрабатывать сайт. При создании нового проекта требования к файлу robots.txt, XML-карте сайта, структуре адресов и каноническим страницам лучше предусмотреть в рамках разработки сайта с учётом поисковой оптимизации (SEO).

Расскажите 
Обсудить проект
  вашем проекте

Ответы на часто задаваемые вопросы

Как часто проверять настройки?
После запуска, переноса, смены CMS, изменения адресов, подключения фильтров и крупных технических работ.
Можно ли использовать один шаблон для разных сайтов?
Нет. Набор технических путей зависит от CMS, структуры и функциональности проекта.
Зачем указывать XML-карту?
Она помогает быстрее обнаруживать важные и обновлённые страницы. В robots.txt размещается полный адрес карты.
Нужно ли одновременно использовать Disallow и noindex?
Обычно нет. При закрытом обходе поисковая система может не увидеть метатег.
Можно ли удалить страницу через Disallow?
Не всегда. Запрет ограничивает загрузку содержания, но сам URL может оставаться известным. Для исключения из выдачи применяют noindex, удаление или защиту паролем.
Влияет ли robots.txt на позиции?
Прямого роста позиций он не обеспечивает. Ошибки могут закрыть важные страницы, а корректные правила помогают организовать обход крупного проекта.
Обязательно ли создавать такой файл?
Нет. При его отсутствии сайт обычно считается открытым для обхода. Однако настройка помогает управлять техническими разделами и указывать адрес Sitemap.
Что такое robots.txt простыми словами?
Это текстовый файл с правилами для поисковых программ. Он сообщает, какие разделы можно сканировать, а какие желательно пропустить.

Читайте также

Какую платформу выбрать для сайта в 2025 году?
#Разработка сайта
09.09.2025
922
Как правильно оформить карточку на Яндекс Картах
#Маркетинг
19.02.2026
1251
Instagram* больше не продаёт — что теперь делать маркетинг-директорам
#Маркетинг
25.08.2025
902
Как попасть в «Поиск с Нейро» Яндекса и Google AI Overviews: чек-лист подготовки сайта (2026)
#SEO продвижение
19.02.2026
461
SEO для медицинских клиник (YMYL): контент, доверие, отзывы, юридические нюансы и рост заявок
#SEO продвижение
19.03.2026
159
Если что, мы используем куки. Оставаясь на сайте, вы соглашаетесь с Политикой в отношении cookie.
Договорились