Генератор robots.txt

Генератор robots.txt

Соберите актуальный robots.txt под практику 2026 года: базовые правила, отдельные группы для ботов, несколько Sitemap и опциональные спецдирективы.

Базовые настройки

Этот блок всегда формирует группу User-agent: *.
По одному абсолютному URL на строку. Можно указать несколько Sitemap.
Для редких случаев: комментарии или специфичные директивы, если вы точно знаете, зачем они нужны.

Правила для отдельных ботов

Используйте отдельные группы для конкретных краулеров: например, Googlebot, bingbot, Yandex, Applebot или AI-ботов.

Результат

0 строк 0 символов

Генератор robots.txt: Как правильно составить файл для управления поисковыми роботами

Всем привет! Если у вас есть сайт, вы наверняка хотите контролировать, как поисковые системы, такие как Google или Яндекс, его сканируют. Файл robots.txt — это основной инструмент для управления обходом сайта поисковыми роботами. Он представляет собой простую текстовую инструкцию, которая подсказывает ботам, какие страницы, файлы или разделы сайта не нужно сканировать.

При этом важно понимать ключевую вещь: robots.txt управляет именно обходом, а не гарантирует удаление URL из индекса. Если нужно исключить страницу из поисковой выдачи, обычно используют noindex, заголовок X-Robots-Tag, удаление страницы или ограничение доступа. Ошибки в robots.txt действительно могут навредить SEO, например если вы случайно закроете от обхода весь сайт или важные технические ресурсы.


Что такое директивы robots.txt?

Файл robots.txt состоит из набора правил, или директив. Вот основные из них:

  • User-agent: Указывает, для какого именно робота предназначено правило. Звездочка (*) означает правило по умолчанию для большинства роботов.
  • Disallow: Запрещает роботу обходить указанный URL, файл или директорию.
  • Allow: Разрешает роботу обходить конкретный URL, даже если более широкая директория запрещена.
  • Sitemap: Указывает путь к файлу Sitemap, что помогает роботам быстрее находить важные URL сайта.
  • Crawl-delay: Задает паузу между запросами робота к серверу, но поддерживается не всеми поисковыми системами, поэтому использовать директиву нужно с учетом конкретного поисковика.
  • Clean-param: Специальная директива для Яндекса, которая помогает указать параметры URL, не влияющие на содержимое страницы.

Правильно составленный файл помогает снизить лишнюю нагрузку на сервер, скрыть от обхода технические разделы и направить поисковых роботов по нужным URL. Но использовать его нужно аккуратно: robots.txt не является инструментом защиты конфиденциальных данных и не должен подменять настройки индексации.


Что важно помнить перед настройкой

Перед созданием файла robots.txt стоит учесть несколько ограничений, о которых часто забывают:

  • Файл должен находиться строго в корне сайта, например: https://example.com/robots.txt.
  • Для каждого поддомена нужен свой robots.txt: файл на www.example.com не управляет обходом blog.example.com.
  • Правила распространяются только на тот протокол и хост, где размещен файл.
  • Если URL уже известен поисковику по внешним ссылкам, он может появиться в выдаче даже при запрете обхода.
  • Не стоит блокировать CSS, JS и другие ресурсы, если без них страница отображается или анализируется некорректно.
  • Секретные разделы лучше защищать авторизацией, а не рассчитывать на robots.txt.

Именно поэтому хороший генератор robots.txt полезен не только для ускорения работы, но и для снижения риска критических ошибок в файле.


Таблицы для создания идеального robots.txt

На практике лучший результат дает не «универсальный шаблон на все случаи», а точечная настройка под структуру сайта. Ниже — удобные таблицы-шпаргалки, которые помогут быстро собрать корректный robots.txt для блога, корпоративного сайта или интернет-магазина.

Таблица 1: Основные User-agent поисковых систем и ботов

Чтобы отдавать инструкции конкретным роботам, нужно знать их «имена». Эта таблица — хороший стартовый набор User-agent для большинства задач по управлению краулерами.

User-agent Кому принадлежит
* Правило по умолчанию для большинства поисковых роботов
Googlebot Основной робот Google
Googlebot-Image Робот Google для обхода изображений
Yandex Основной робот Яндекса
YandexImages Робот Яндекса для изображений
bingbot Основной робот Microsoft Bing
DuckDuckBot Робот поисковой системы DuckDuckGo
Mail.RuBot Робот экосистемы Mail.ru
Slurp Робот Yahoo
AhrefsBot Робот SEO-инструмента Ahrefs
SemrushBot Робот SEO-инструмента Semrush
MJ12bot Робот Majestic

Таблица 2: Примеры правил Disallow и Allow

Правильное использование директив Disallow и Allow — основа корректного robots.txt. Ниже собраны самые частые сценарии, которые помогают закрыть от обхода технические разделы и служебные страницы.

Правило Описание действия
Disallow: /private/ Запретить обход всей директории private
Disallow: /private/page.html Запретить обход конкретного файла page.html
Disallow: / Запретить обход всего сайта (использовать только осознанно)
Disallow: Не задавать ограничений на обход для выбранного робота
Disallow: /admin/
Allow: /admin/styles.css
Запретить обход папки admin, но разрешить доступ к нужному файлу внутри неё
Disallow: /images/
Allow: /images/logo.png
Запретить обход папки с изображениями, но разрешить доступ к логотипу
Disallow: /search/ Закрыть от обхода страницы внутреннего поиска
Disallow: /cart/ Закрыть от обхода корзину интернет-магазина
Disallow: /checkout/ Закрыть от обхода страницу оформления заказа
Disallow: /wp-admin/ Закрыть административную панель WordPress
Disallow: /?s= Закрыть URL с параметром внутреннего поиска

Таблица 3: Использование спецсимволов (*) и ($) для гибкой настройки

Для более тонкой настройки правил удобно использовать шаблоны со спецсимволами. Они позволяют описывать сразу группы URL и сокращают размер файла.

Правило со спецсимволом Что оно делает
Disallow: /*.pdf$ Запретить обход всех URL, которые заканчиваются на .pdf
Disallow: /*.doc$ Запретить обход всех URL, которые заканчиваются на .doc
Disallow: /products/*?size= Запретить обход карточек товаров с параметром size
Disallow: /news/archive/*/ Запретить обход поддиректорий внутри архива новостей
Disallow: /*.php$ Запретить обход URL, которые заканчиваются на .php
Disallow: /*/feed/$ Запретить обход RSS-лент во всех директориях
Disallow: /photo_gallery/*.jpg$ Запретить обход JPG-файлов только в директории photo_gallery
Allow: /*.css$ Разрешить обход CSS-файлов на сайте
Allow: /*.js$ Разрешить обход JS-файлов на сайте
Disallow: /*?sessionid= Запретить обход URL с идентификаторами сессий
Disallow: /private Запретить обход всех URL, начинающихся с /private
Allow: /public/*.html$ Разрешить обход HTML-файлов в директории public

Таблица 4: Готовые шаблоны robots.txt для популярных CMS

У каждой CMS есть свои технические разделы и служебные URL. Ниже — не «жесткие правила», а стартовые шаблоны, которые нужно адаптировать под конкретный проект и обязательно тестировать перед публикацией.

Платформа (CMS) Рекомендуемые базовые правила
WordPress User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Sitemap: https://example.com/sitemap_index.xml
Joomla User-agent: *
Disallow: /administrator/
Disallow: /cache/
Disallow: /cli/
Disallow: /installation/
Disallow: /tmp/
Sitemap: https://example.com/sitemap.xml
Shopify User-agent: *
Disallow: /admin
Disallow: /cart
Disallow: /orders
Disallow: /checkout
Disallow: /account
Disallow: /search
Sitemap: https://example.com/sitemap.xml
OpenCart User-agent: *
Disallow: /admin/
Disallow: /*?sort=
Disallow: /*?limit=
Disallow: /*?route=account/
Disallow: /*?route=affiliate/
Disallow: /*?route=checkout/
Disallow: /*?route=product/search
Bitrix User-agent: *
Disallow: /bitrix/
Disallow: /auth/
Disallow: /personal/
Disallow: /search/
Disallow: /*?print=
Disallow: /*?logout=
Sitemap: https://example.com/sitemap.xml

Важно: не копируйте шаблоны бездумно. Если сайт использует CSS, JS, изображения или другие ресурсы для корректной отрисовки страниц, не закрывайте их от обхода без веской причины.


Заключение

Файл robots.txt — это важный инструмент в арсенале веб-мастера и SEO-специалиста. Он помогает направлять поисковых роботов по нужному пути, экономить краулинговый бюджет и убирать из обхода технические и малоценные URL.

Но главное правило простое: robots.txt нужен для управления обходом, а не для надежного удаления страниц из поиска. Если вы хотите убрать URL из выдачи, используйте noindex, корректные HTTP-статусы, удаление страницы или ограничение доступа.

Используйте генератор robots.txt, чтобы избежать синтаксических ошибок, сверяйтесь с таблицами для типовых задач и обязательно проверяйте итоговый файл в инструментах для веб-мастеров Google и Яндекса. И не забывайте: после любого изменения robots.txt стоит проверить доступность файла по адресу /robots.txt и убедиться, что сервер отдает корректный ответ.

Сайт для поиска и продажи лидов (потенциальных клиентов). Здесь вы можете разместить бесплатно объявления о заявках, звонках или базах данных. Администрация сайта не несет ответственности за размещаемую пользователями информацию. Администрация сайта не проверяет пользователей и объявления. Прежде чем совершать сделку мы рекомендуем заключить договор. Либо покупать лиды без предоплат.