Привет Павел Гречко на связи и в этой статьей я расскажу вам про Основные директивы Robots.txt
Файл robots.txt — это текстовый документ, который располагается в корневой директории сайта и служит для управления доступом поисковых роботов к его страницам. С его помощью вебмастера указывают, какие разделы нужно индексировать, а какие следует скрыть от поисковой выдачи (например, служебные скрипты, дубли страниц или личный кабинет).
- Базовый синтаксис и правила чтения
- Главные директивы Robots.txt
- User-agent
- Disallow
- Allow
- Sitemap
- Crawl-delay
- Clean-param (специфика Яндекса)
- Специальные символы и операторы
- Примеры готовых конфигураций (Шпаргалка)
- Универсальный базовый шаблон
- Для CMS WordPress
- Для интернет-магазина
- Топ-5 частых ошибок при составлении robots.txt
- Как проверить правильность файла robots.txt
- Заключение
Однако важно помнить главное правило: robots.txt — это лишь рекомендация для поисковых систем, а не инструмент защиты конфиденциальных данных. Если страница закрыта в robots.txt, но на нее ведут внешние ссылки, поисковик может добавить ее в индекс без текстового содержимого.
Файл должен быть доступен по адресу вашсайт.ru/robots.txt, написан в кодировке UTF-8 (без BOM) и весить не более 32 КБ.
Базовый синтаксис и правила чтения
Прежде чем переходить к конкретным директивам, нужно усвоить базовые правила чтения файла поисковыми роботами:
- Регистрозависимость. Пути к файлам и директориям чувствительны к регистру.
/Adminи/adminдля робота — это две разные папки. Сами директивы (User-agent, Disallow) регистронезависимы, но по стандарту их принято писать с заглавной буквы. - Приоритет правил (специфичность). Если для одного робота задано несколько правил, робот выберет то, которое имеет наибольшую длину (наиболее специфичное). Например, правило
Disallow: /catalog/будет иметь меньший приоритет, чемAllow: /catalog/sale/. - Группировка. Директивы применяются блоками. Каждый новый блок начинается с указания
User-agent. Пустые строки между блоками обязательны!
Главные директивы Robots.txt
User-agent
Директива указывает, к какому именно поисковому роботу применяются последующие правила.
User-agent: *— правила применяются ко всем роботам.User-agent: Yandex— правила только для Яндекса.User-agent: Googlebot— правила только для Google.
Пример:
- User-agent: Yandex
- Disallow: /wp-admin/
User-agent: *
Disallow: /cgi-bin/
Disallow
Самая популярная директива. Запрещает роботу сканировать указанные страницы или директории.
Disallow: /— закрывает весь сайт.Disallow: /cart/— закрывает папку корзины.Disallow: /page.html— закрывает конкретную страницу.
Allow
Директива-исключение, которая разрешает сканирование определенного URL, если он закрыт директивой Disallow. Чаще всего используется для открытия доступа к CSS и JS файлам, которые могут находиться в закрытой папке.
Пример:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
Sitemap
Указывает поисковому роботу путь к файлам карты сайта (XML). Это помогает роботам быстрее находить новые и обновленные страницы. В одном файле robots.txt можно указать несколько ссылок на разные sitemap.
Пример:
- Sitemap: https://site.ru/sitemap.xml
- Sitemap: https://site.ru/sitemap-news.xml
Crawl-delay
Задает интервал (в секундах) между скачиванием страниц сайта, чтобы снизить нагрузку на сервер.
- Важно: Яндекс поддерживает эту директиву и учитывает ее. Google официально игнорирует
Crawl-delayвrobots.txt(скорость обхода настраивается через Google Search Console).
Пример:
- User-agent: Yandex
- Crawl-delay: 2
Clean-param (специфика Яндекса)
Директива, которую понимает только Яндекс. Она позволяет «склеивать» дубли страниц, возникающие из-за UTM-меток, параметров сортировки или сессий. Робот будет игнорировать указанные параметры при индексации.
Пример:
- User-agent: Yandex
- Clean-param: utm_source&utm_medium&sort
Специальные символы и операторы
Для гибкой настройки правил используются два спецсимвола:
-
Звездочка (
*) — означает любую последовательность символов (включая пустую). Пример:Disallow: /*?sort=закроет все URL, в которых встречается параметр сортировки. -
Знак доллара (
$) — указывает на точный конец строки. Пример:Disallow: /$закроет только главную страницу сайта, но оставит открытыми все вложенные разделы (так как у них путь не заканчивается на/).
Примеры готовых конфигураций (Шпаргалка)
Универсальный базовый шаблон
- User-agent: *
- Disallow: /cgi-bin
- Disallow: /wp-admin
- Disallow: /wp-includes
- Disallow: /*?s=
- Disallow: /*?utm_
Sitemap: https://site.ru/sitemap.xml
Для CMS WordPress
- User-agent: *
- Disallow: /wp-admin/
- Disallow: /wp-includes/
- Disallow: /wp-content/plugins/
- Allow: /wp-content/uploads/
- Allow: /wp-admin/admin-ajax.php
Sitemap: https://site.ru/sitemap_index.xml
Для интернет-магазина
- User-agent: *
- Disallow: /cart/
- Disallow: /checkout/
- Disallow: /my-account/
- Disallow: /*?sort=
- Disallow: /*?filter=
- Clean-param: utm_source&utm_medium&utm_campaign
Sitemap: https://shop.ru/sitemap.xml
Топ-5 частых ошибок при составлении robots.txt
- Случайная блокировка всего сайта. Ошибка в синтаксисе, например,
Disallow: /(с пробелом в конце) или случайное указание слэша без вложенных путей, может полностью скрыть сайт от поисковиков. - Закрытие важных ресурсов (CSS, JS). Если закрыть папки со стилями и скриптами, Google и Яндекс не смогут корректно отобразить страницу и могут понизить ее в ранжировании (особенно это критично для мобильной адаптации).
- Наличие нескольких файлов robots.txt. Файл должен быть строго один на домен. Если у вас есть поддомены (m.site.ru, shop.site.ru) или склейка http/https, для каждого протокола и поддомена нужен свой отдельный
robots.txt. - Использование устаревшей директивы Host. Директива
Host, которую использовали для указания главного зеркала (www или без www), была официально удалена из рекомендаций Яндекса еще в 2018 году. Ее наличие сейчас — признак плохого тона и потенциальная ошибка. - Блокировка через robots.txt вместо noindex. Многие закрывают страницы в
robots.txt, думая, что они исчезнут из поиска. Если на закрытую страницу есть внешние ссылки, она попадет в индекс, но без описания. Для полного удаления из поиска используйте тег<meta name="robots" content="noindex">или HTTP-заголовокX-Robots-Tag.
Как проверить правильность файла robots.txt
После внесения изменений обязательно проверьте файл на корректность:
- Яндекс.Вебмастер: раздел «Инструменты» -> «Анализ robots.txt». Позволяет проверить доступность URL для робота Яндекса и валидность синтаксиса.
- Google Search Console: инструмент «Проверка URL» и старые инструменты анализа robots.txt (сейчас функционал интегрирован в общую проверку индексации).
- Сторонние сервисы: существует множество онлайн-валидаторов (например, PR-CY или Seolib), которые подсвечивают синтаксические ошибки и дубликаты правил.
- Ручная проверка: просто откройте
вашсайт.ru/robots.txtв браузере. Файл должен отдавать HTTP-код 200 OK, а не 404 Not Found или 500 Internal Server Error.
Заключение
Грамотно настроенный файл robots.txt помогает управлять краулинговым бюджетом, ускоряет индексацию важных страниц и снижает нагрузку на хостинг, отсекая мусорные URL. Однако слепое копирование чужих конфигураций без учета архитектуры вашего сайта может привести к выпадению страниц из поиска.
Призыв к действию: Не откладывайте на потом! Прямо сейчас откройте свой сайт, проверьте файл robots.txt через вебмастера и убедитесь, что вы случайно не закрыли важные разделы от поисковых роботов.
Есть проблемы с сайтом и SEO?
Попробуйте самостоятельно улучшить свой сайт, используя мои чек-листы и рекомендации
Гибкие тарифы на SEO
Для новых сайтов и действующего бизнеса
от 12 000 рублей.