Генератор robots.txt
Создайте файл robots.txt с правилами Allow и Disallow для каждого бота, ссылками на sitemap и задержкой сканирования. Шаблоны для WordPress и интернет-магазинов, с проверкой.
Загрузка: Генератор robots.txt…
Ваши файлы не покидают устройство
Как пользоваться: Генератор robots.txt
- 1
Откройте «Генератор robots.txt» на этой странице. Инструмент загружается прямо в браузере.
- 2
Добавьте файл, текст или значения и настройте параметры.
- 3
Скопируйте или скачайте результат. Ничего не загружается и не хранится.
Об инструменте
Файл robots.txt лежит в корне сайта и сообщает поисковым роботам, какие разделы сайта им можно посещать. Этот генератор robots.txt создаёт файл за вас по простой форме: выберите ботов, добавьте правила Allow и Disallow, укажите sitemap, а затем скопируйте или скачайте файл, который проверяется на ошибки прямо по ходу работы.
Как создать файл robots.txt
- Начните с шаблона: Open to all, Block all, WordPress или E-commerce.
- Выберите user agents: все боты (*) или конкретные, например Googlebot, Bingbot, DuckDuckBot, YandexBot, Baiduspider, Slurp, facebookexternalhit, Twitterbot, LinkedInBot, либо своё имя.
- Добавьте правила Disallow и Allow для путей или выберите из списка часто блокируемых путей.
- Укажите URL вашего sitemap и при необходимости задержку сканирования и предпочтительный хост.
- Проверьте результаты валидации и предпросмотр, затем скачайте robots.txt и загрузите его в корень сайта.
Кратко о синтаксисе
| Правило | Значение |
|---|---|
| User-agent: * | Правила ниже действуют для всех ботов |
| Disallow: /admin/ | Не сканировать ничего внутри /admin/ |
| Allow: /admin/help | Исключение из более широкого Disallow |
| Disallow: /*.pdf$ | Блокировать все URL, оканчивающиеся на .pdf |
| Disallow: /*? | Блокировать URL с параметрами |
| Sitemap: https://example.com/sitemap.xml | Где находится ваш sitemap |
Важно знать
- Robots.txt управляет сканированием, а не индексацией. Заблокированная страница всё равно может появиться в Google, если на неё ссылаются другие сайты. Чтобы убрать страницу из результатов поиска, используйте метатег noindex и разрешите её сканировать.
- Это не защита. Файл общедоступен, и прочитать его может кто угодно. Закрывайте приватные разделы паролем.
- Не блокируйте CSS, JavaScript и изображения, нужные вашим страницам: Google отрисовывает страницы и иначе может оценить их неверно.
- Google игнорирует Crawl-delay, а Bing и некоторые другие его учитывают.
- Один файл на хост по адресу https://yourdomain.com/robots.txt, имя в нижнем регистре.
После загрузки проверьте файл в Google Search Console. Затем создайте sitemap с помощью генератора XML sitemap и задайте нужные теги для каждой страницы в генераторе метатегов.
Частые вопросы
Куда поместить файл robots.txt?
В корень домена, чтобы он открывался по адресу https://yourdomain.com/robots.txt. Каждому поддомену нужен свой файл.
Мешает ли robots.txt странице появиться в Google?
Нет. Он запрещает сканирование, а не индексацию. Добавьте на страницу метатег noindex и не блокируйте её в robots.txt, чтобы Google увидел noindex.
Как заблокировать всех ботов?
Используйте шаблон Block all: он записывает User-agent: * и затем Disallow: /. Применяйте его только для тестовых или закрытых сайтов.
Чем Allow отличается от Disallow?
Disallow блокирует путь, а Allow создаёт исключение внутри заблокированного пути. Если правила пересекаются, Google следует самому конкретному.
Нужно ли добавлять sitemap в robots.txt?
Да. Строка Sitemap помогает всем поисковым системам найти его, в дополнение к отправке в Search Console.
Можно ли заблокировать ИИ-краулеры?
Да. Добавьте свой user agent, например GPTBot или CCBot, с Disallow: /. Добросовестные боты это соблюдают, другие могут игнорировать.
