Генератор robots.txt: Как правильно составить файл для управления поисковыми роботами
Всем привет! Если у вас есть сайт, вы наверняка хотите контролировать, как поисковые системы, такие как Google или Яндекс, его сканируют. Файл robots.txt — это основной инструмент для управления обходом сайта поисковыми роботами. Он представляет собой простую текстовую инструкцию, которая подсказывает ботам, какие страницы, файлы или разделы сайта не нужно сканировать.
При этом важно понимать ключевую вещь: robots.txt управляет именно обходом, а не гарантирует удаление URL из индекса. Если нужно исключить страницу из поисковой выдачи, обычно используют noindex, заголовок X-Robots-Tag, удаление страницы или ограничение доступа. Ошибки в robots.txt действительно могут навредить SEO, например если вы случайно закроете от обхода весь сайт или важные технические ресурсы.
Что такое директивы robots.txt?
Файл robots.txt состоит из набора правил, или директив. Вот основные из них:
- User-agent: Указывает, для какого именно робота предназначено правило. Звездочка (*) означает правило по умолчанию для большинства роботов.
- Disallow: Запрещает роботу обходить указанный URL, файл или директорию.
- Allow: Разрешает роботу обходить конкретный URL, даже если более широкая директория запрещена.
- Sitemap: Указывает путь к файлу Sitemap, что помогает роботам быстрее находить важные URL сайта.
- Crawl-delay: Задает паузу между запросами робота к серверу, но поддерживается не всеми поисковыми системами, поэтому использовать директиву нужно с учетом конкретного поисковика.
- Clean-param: Специальная директива для Яндекса, которая помогает указать параметры URL, не влияющие на содержимое страницы.
Правильно составленный файл помогает снизить лишнюю нагрузку на сервер, скрыть от обхода технические разделы и направить поисковых роботов по нужным URL. Но использовать его нужно аккуратно: robots.txt не является инструментом защиты конфиденциальных данных и не должен подменять настройки индексации.
Что важно помнить перед настройкой
Перед созданием файла robots.txt стоит учесть несколько ограничений, о которых часто забывают:
- Файл должен находиться строго в корне сайта, например:
https://example.com/robots.txt. - Для каждого поддомена нужен свой robots.txt: файл на
www.example.comне управляет обходомblog.example.com. - Правила распространяются только на тот протокол и хост, где размещен файл.
- Если URL уже известен поисковику по внешним ссылкам, он может появиться в выдаче даже при запрете обхода.
- Не стоит блокировать CSS, JS и другие ресурсы, если без них страница отображается или анализируется некорректно.
- Секретные разделы лучше защищать авторизацией, а не рассчитывать на robots.txt.
Именно поэтому хороший генератор robots.txt полезен не только для ускорения работы, но и для снижения риска критических ошибок в файле.
Таблицы для создания идеального robots.txt
На практике лучший результат дает не «универсальный шаблон на все случаи», а точечная настройка под структуру сайта. Ниже — удобные таблицы-шпаргалки, которые помогут быстро собрать корректный robots.txt для блога, корпоративного сайта или интернет-магазина.
Таблица 1: Основные User-agent поисковых систем и ботов
Чтобы отдавать инструкции конкретным роботам, нужно знать их «имена». Эта таблица — хороший стартовый набор User-agent для большинства задач по управлению краулерами.
| User-agent | Кому принадлежит |
|---|---|
* |
Правило по умолчанию для большинства поисковых роботов |
Googlebot |
Основной робот Google |
Googlebot-Image |
Робот Google для обхода изображений |
Yandex |
Основной робот Яндекса |
YandexImages |
Робот Яндекса для изображений |
bingbot |
Основной робот Microsoft Bing |
DuckDuckBot |
Робот поисковой системы DuckDuckGo |
Mail.RuBot |
Робот экосистемы Mail.ru |
Slurp |
Робот Yahoo |
AhrefsBot |
Робот SEO-инструмента Ahrefs |
SemrushBot |
Робот SEO-инструмента Semrush |
MJ12bot |
Робот Majestic |
Таблица 2: Примеры правил Disallow и Allow
Правильное использование директив Disallow и Allow — основа корректного robots.txt. Ниже собраны самые частые сценарии, которые помогают закрыть от обхода технические разделы и служебные страницы.
| Правило | Описание действия |
|---|---|
Disallow: /private/ |
Запретить обход всей директории private |
Disallow: /private/page.html |
Запретить обход конкретного файла page.html |
Disallow: / |
Запретить обход всего сайта (использовать только осознанно) |
Disallow: |
Не задавать ограничений на обход для выбранного робота |
Disallow: /admin/Allow: /admin/styles.css |
Запретить обход папки admin, но разрешить доступ к нужному файлу внутри неё |
Disallow: /images/Allow: /images/logo.png |
Запретить обход папки с изображениями, но разрешить доступ к логотипу |
Disallow: /search/ |
Закрыть от обхода страницы внутреннего поиска |
Disallow: /cart/ |
Закрыть от обхода корзину интернет-магазина |
Disallow: /checkout/ |
Закрыть от обхода страницу оформления заказа |
Disallow: /wp-admin/ |
Закрыть административную панель WordPress |
Disallow: /?s= |
Закрыть URL с параметром внутреннего поиска |
Таблица 3: Использование спецсимволов (*) и ($) для гибкой настройки
Для более тонкой настройки правил удобно использовать шаблоны со спецсимволами. Они позволяют описывать сразу группы URL и сокращают размер файла.
| Правило со спецсимволом | Что оно делает |
|---|---|
Disallow: /*.pdf$ |
Запретить обход всех URL, которые заканчиваются на .pdf |
Disallow: /*.doc$ |
Запретить обход всех URL, которые заканчиваются на .doc |
Disallow: /products/*?size= |
Запретить обход карточек товаров с параметром size |
Disallow: /news/archive/*/ |
Запретить обход поддиректорий внутри архива новостей |
Disallow: /*.php$ |
Запретить обход URL, которые заканчиваются на .php |
Disallow: /*/feed/$ |
Запретить обход RSS-лент во всех директориях |
Disallow: /photo_gallery/*.jpg$ |
Запретить обход JPG-файлов только в директории photo_gallery |
Allow: /*.css$ |
Разрешить обход CSS-файлов на сайте |
Allow: /*.js$ |
Разрешить обход JS-файлов на сайте |
Disallow: /*?sessionid= |
Запретить обход URL с идентификаторами сессий |
Disallow: /private |
Запретить обход всех URL, начинающихся с /private |
Allow: /public/*.html$ |
Разрешить обход HTML-файлов в директории public |
Таблица 4: Готовые шаблоны robots.txt для популярных CMS
У каждой CMS есть свои технические разделы и служебные URL. Ниже — не «жесткие правила», а стартовые шаблоны, которые нужно адаптировать под конкретный проект и обязательно тестировать перед публикацией.
| Платформа (CMS) | Рекомендуемые базовые правила |
|---|---|
| WordPress | User-agent: * |
| Joomla | User-agent: * |
| Shopify | User-agent: * |
| OpenCart | User-agent: * |
| Bitrix | User-agent: * |
Важно: не копируйте шаблоны бездумно. Если сайт использует CSS, JS, изображения или другие ресурсы для корректной отрисовки страниц, не закрывайте их от обхода без веской причины.
Заключение
Файл robots.txt — это важный инструмент в арсенале веб-мастера и SEO-специалиста. Он помогает направлять поисковых роботов по нужному пути, экономить краулинговый бюджет и убирать из обхода технические и малоценные URL.
Но главное правило простое: robots.txt нужен для управления обходом, а не для надежного удаления страниц из поиска. Если вы хотите убрать URL из выдачи, используйте noindex, корректные HTTP-статусы, удаление страницы или ограничение доступа.
Используйте генератор robots.txt, чтобы избежать синтаксических ошибок, сверяйтесь с таблицами для типовых задач и обязательно проверяйте итоговый файл в инструментах для веб-мастеров Google и Яндекса. И не забывайте: после любого изменения robots.txt стоит проверить доступность файла по адресу /robots.txt и убедиться, что сервер отдает корректный ответ.