You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何编写robots.txt代码禁止部分指定网页被搜索引擎收录

robots.txt 配置方案

首先确认你站点的博客内容是否使用统一的路径前缀,主流WordPress站点默认的博客内容路径前缀为/blog/,若你的站点博客符合该规则,直接使用下方配置即可:

User-agent: *
Disallow: /wp-admin/
Disallow: /blog/

规则说明

  • User-agent: *:代表所有搜索引擎爬虫都需要遵守下方的禁止爬取规则
  • 保留原有Disallow: /wp-admin/规则,继续禁止爬虫访问站点后台路径
  • 新增的Disallow: /blog/规则,会禁止爬虫爬取https://snapvisibility.com/blog/路径下的所有子页面,覆盖全部博客内容
  • 若你的案例研究内容也有统一路径前缀,比如/case-study/,只需新增一行Disallow: /case-study/即可禁止对应内容被爬取

特殊情况处理

如果你的博客内容没有统一路径前缀,分散在根目录下,可以先通过WordPress后台固定链接设置为博客内容统一添加/blog/前缀,再使用上述配置;如果不方便修改路径,也可以配合页面级的noindex规则实现禁止收录的需求。

注意:robots.txt是搜索引擎爬虫自愿遵守的规则,恶意爬虫不会受其约束。如果要确保内容绝对不被公开收录,建议同时在对应页面的HTML头部添加<meta name="robots" content="noindex">标签,或者在服务器返回响应头中添加X-Robots-Tag: noindex字段。

内容的提问来源于stack exchange,提问作者snapvisibility

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 15:18:02