Привет Павел Гречко на связи и в этой статьей я расскажу вам про Основные директивы Robots.txt

Файл robots.txt — это текстовый документ, который располагается в корневой директории сайта и служит для управления доступом поисковых роботов к его страницам. С его помощью вебмастера указывают, какие разделы нужно индексировать, а какие следует скрыть от поисковой выдачи (например, служебные скрипты, дубли страниц или личный кабинет).

Содержание

Однако важно помнить главное правило: robots.txt — это лишь рекомендация для поисковых систем, а не инструмент защиты конфиденциальных данных. Если страница закрыта в robots.txt, но на нее ведут внешние ссылки, поисковик может добавить ее в индекс без текстового содержимого.

Файл должен быть доступен по адресу вашсайт.ru/robots.txt, написан в кодировке UTF-8 (без BOM) и весить не более 32 КБ.

Базовый синтаксис и правила чтения

Прежде чем переходить к конкретным директивам, нужно усвоить базовые правила чтения файла поисковыми роботами:

  1. Регистрозависимость. Пути к файлам и директориям чувствительны к регистру. /Admin и /admin для робота — это две разные папки. Сами директивы (User-agent, Disallow) регистронезависимы, но по стандарту их принято писать с заглавной буквы.
  2. Приоритет правил (специфичность). Если для одного робота задано несколько правил, робот выберет то, которое имеет наибольшую длину (наиболее специфичное). Например, правило Disallow: /catalog/ будет иметь меньший приоритет, чем Allow: /catalog/sale/.
  3. Группировка. Директивы применяются блоками. Каждый новый блок начинается с указания User-agent. Пустые строки между блоками обязательны!

Главные директивы Robots.txt

User-agent

Директива указывает, к какому именно поисковому роботу применяются последующие правила.

  • User-agent: * — правила применяются ко всем роботам.
  • User-agent: Yandex — правила только для Яндекса.
  • User-agent: Googlebot — правила только для Google.

Пример:


- User-agent: Yandex
- Disallow: /wp-admin/

User-agent: *
Disallow: /cgi-bin/

Disallow

Самая популярная директива. Запрещает роботу сканировать указанные страницы или директории.

  • Disallow: / — закрывает весь сайт.
  • Disallow: /cart/ — закрывает папку корзины.
  • Disallow: /page.html — закрывает конкретную страницу.

Allow

Директива-исключение, которая разрешает сканирование определенного URL, если он закрыт директивой Disallow. Чаще всего используется для открытия доступа к CSS и JS файлам, которые могут находиться в закрытой папке.

Пример:


- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php

Sitemap

Указывает поисковому роботу путь к файлам карты сайта (XML). Это помогает роботам быстрее находить новые и обновленные страницы. В одном файле robots.txt можно указать несколько ссылок на разные sitemap.

Пример:


- Sitemap: https://site.ru/sitemap.xml
- Sitemap: https://site.ru/sitemap-news.xml

Crawl-delay

Задает интервал (в секундах) между скачиванием страниц сайта, чтобы снизить нагрузку на сервер.

  • Важно: Яндекс поддерживает эту директиву и учитывает ее. Google официально игнорирует Crawl-delay в robots.txt (скорость обхода настраивается через Google Search Console).

Пример:


- User-agent: Yandex
- Crawl-delay: 2

Clean-param (специфика Яндекса)

Директива, которую понимает только Яндекс. Она позволяет «склеивать» дубли страниц, возникающие из-за UTM-меток, параметров сортировки или сессий. Робот будет игнорировать указанные параметры при индексации.

Пример:


- User-agent: Yandex
- Clean-param: utm_source&utm_medium&sort

Специальные символы и операторы

Для гибкой настройки правил используются два спецсимвола:

  • Звездочка (*) — означает любую последовательность символов (включая пустую). Пример: Disallow: /*?sort= закроет все URL, в которых встречается параметр сортировки.

  • Знак доллара ($) — указывает на точный конец строки. Пример: Disallow: /$ закроет только главную страницу сайта, но оставит открытыми все вложенные разделы (так как у них путь не заканчивается на /).

Примеры готовых конфигураций (Шпаргалка)

Универсальный базовый шаблон


- User-agent: *
- Disallow: /cgi-bin
- Disallow: /wp-admin
- Disallow: /wp-includes
- Disallow: /*?s=
- Disallow: /*?utm_

Sitemap: https://site.ru/sitemap.xml

Для CMS WordPress


- User-agent: *
- Disallow: /wp-admin/
- Disallow: /wp-includes/
- Disallow: /wp-content/plugins/
- Allow: /wp-content/uploads/
- Allow: /wp-admin/admin-ajax.php

Sitemap: https://site.ru/sitemap_index.xml

Для интернет-магазина


- User-agent: *
- Disallow: /cart/
- Disallow: /checkout/
- Disallow: /my-account/
- Disallow: /*?sort=
- Disallow: /*?filter=
- Clean-param: utm_source&utm_medium&utm_campaign

Sitemap: https://shop.ru/sitemap.xml

Топ-5 частых ошибок при составлении robots.txt

  1. Случайная блокировка всего сайта. Ошибка в синтаксисе, например, Disallow: / (с пробелом в конце) или случайное указание слэша без вложенных путей, может полностью скрыть сайт от поисковиков.
  2. Закрытие важных ресурсов (CSS, JS). Если закрыть папки со стилями и скриптами, Google и Яндекс не смогут корректно отобразить страницу и могут понизить ее в ранжировании (особенно это критично для мобильной адаптации).
  3. Наличие нескольких файлов robots.txt. Файл должен быть строго один на домен. Если у вас есть поддомены (m.site.ru, shop.site.ru) или склейка http/https, для каждого протокола и поддомена нужен свой отдельный robots.txt.
  4. Использование устаревшей директивы Host. Директива Host, которую использовали для указания главного зеркала (www или без www), была официально удалена из рекомендаций Яндекса еще в 2018 году. Ее наличие сейчас — признак плохого тона и потенциальная ошибка.
  5. Блокировка через robots.txt вместо noindex. Многие закрывают страницы в robots.txt, думая, что они исчезнут из поиска. Если на закрытую страницу есть внешние ссылки, она попадет в индекс, но без описания. Для полного удаления из поиска используйте тег <meta name="robots" content="noindex"> или HTTP-заголовок X-Robots-Tag.

Как проверить правильность файла robots.txt

После внесения изменений обязательно проверьте файл на корректность:

  • Яндекс.Вебмастер: раздел «Инструменты» -> «Анализ robots.txt». Позволяет проверить доступность URL для робота Яндекса и валидность синтаксиса.
  • Google Search Console: инструмент «Проверка URL» и старые инструменты анализа robots.txt (сейчас функционал интегрирован в общую проверку индексации).
  • Сторонние сервисы: существует множество онлайн-валидаторов (например, PR-CY или Seolib), которые подсвечивают синтаксические ошибки и дубликаты правил.
  • Ручная проверка: просто откройте вашсайт.ru/robots.txt в браузере. Файл должен отдавать HTTP-код 200 OK, а не 404 Not Found или 500 Internal Server Error.

Заключение

Грамотно настроенный файл robots.txt помогает управлять краулинговым бюджетом, ускоряет индексацию важных страниц и снижает нагрузку на хостинг, отсекая мусорные URL. Однако слепое копирование чужих конфигураций без учета архитектуры вашего сайта может привести к выпадению страниц из поиска.

Призыв к действию: Не откладывайте на потом! Прямо сейчас откройте свой сайт, проверьте файл robots.txt через вебмастера и убедитесь, что вы случайно не закрыли важные разделы от поисковых роботов.

Оцените эту статью

Есть проблемы с сайтом и SEO?

Попробуйте самостоятельно улучшить свой сайт, используя мои чек-листы и рекомендации

Гибкие тарифы на SEO

Для новых сайтов и действующего бизнеса
от 12 000 рублей.

Подробнее