Robots.txt 生成器
为每个爬虫设置 Allow 和 Disallow 规则,添加 sitemap 链接和抓取延迟,生成 robots.txt 文件。提供 WordPress 和网店预设,并带有校验。
正在加载Robots.txt 生成器…
您的文件绝不离开您的设备
如何使用Robots.txt 生成器
- 1
在此页面打开Robots.txt 生成器,它直接在浏览器中加载。
- 2
添加文件、文本或数值,并调整设置。
- 3
复制或下载结果。不会上传或存储任何内容。
关于此工具
robots.txt 文件位于网站根目录,用来告诉搜索引擎爬虫可以访问网站的哪些部分。这款 robots.txt 生成器通过简单的表单为你生成文件:选择爬虫,添加 Allow 和 Disallow 规则,填写 sitemap 链接,然后复制或下载一份在编辑过程中实时检查错误的文件。
如何创建 robots.txt 文件
- 从预设开始:Open to all、Block all、WordPress 或 E-commerce。
- 选择 user agent:所有爬虫(*),或特定爬虫,如 Googlebot、Bingbot、DuckDuckBot、YandexBot、Baiduspider、Slurp、facebookexternalhit、Twitterbot、LinkedInBot,或自定义名称。
- 为路径添加 Disallow 和 Allow 规则,或从常见的屏蔽路径中选择。
- 添加你的 sitemap 网址,如有需要,再设置抓取延迟和首选主机。
- 查看校验结果和预览,然后下载 robots.txt 并上传到网站根目录。
语法简介
| 规则 | 含义 |
|---|---|
| User-agent: * | 以下规则适用于所有爬虫 |
| Disallow: /admin/ | 不抓取 /admin/ 下的任何内容 |
| Allow: /admin/help | 更宽泛 Disallow 规则中的例外 |
| Disallow: /*.pdf$ | 屏蔽所有以 .pdf 结尾的网址 |
| Disallow: /*? | 屏蔽带参数的网址 |
| Sitemap: https://example.com/sitemap.xml | sitemap 的位置 |
重要须知
- robots.txt 控制的是抓取,而不是索引。如果其他网站链接到被屏蔽的页面,它仍可能出现在 Google 中。要让页面不出现在搜索结果中,请使用 noindex meta 标签,并允许抓取该页面。
- 它不是安全措施。该文件是公开的,任何人都能读取。请用登录保护私密区域。
- 不要屏蔽页面需要的 CSS、JavaScript 或图片;Google 会渲染页面,否则可能会误判。
- Google 会忽略 Crawl-delay;Bing 和其他一些搜索引擎会遵守。
- 每个主机一个文件,位于 https://yourdomain.com/robots.txt,文件名使用小写。
上传后,在 Google Search Console 中测试该文件。然后使用 XML sitemap 生成器创建 sitemap,并用 meta 标签生成器为每个页面设置合适的标签。
常见问题
robots.txt 文件应放在哪里?
放在域名根目录,确保可以通过 https://yourdomain.com/robots.txt 访问。每个子域名都需要自己的文件。
robots.txt 能阻止页面出现在 Google 中吗?
不能。它阻止的是抓取,而不是索引。请在页面上使用 noindex meta 标签,并且不要在 robots.txt 中屏蔽它,这样 Google 才能看到 noindex。
如何屏蔽所有爬虫?
使用 Block all 预设,它会写入 User-agent: *,后面跟着 Disallow: /。只在测试环境或私密网站上使用。
Allow 和 Disallow 有什么区别?
Disallow 屏蔽某个路径;Allow 在被屏蔽的路径中设置例外。规则重叠时,Google 遵循最具体的那条。
应该把 sitemap 添加到 robots.txt 吗?
应该。除了在 Search Console 中提交外,添加 Sitemap 行能帮助所有搜索引擎找到它。
可以屏蔽 AI 爬虫吗?
可以。添加自定义 user agent,例如 GPTBot 或 CCBot,并设置 Disallow: /。守规矩的爬虫会遵守,其他爬虫可能不会。
