如何编写robots.txt代码禁止部分指定网页被搜索引擎收录
robots.txt 配置方案
首先确认你站点的博客内容是否使用统一的路径前缀,主流WordPress站点默认的博客内容路径前缀为/blog/,若你的站点博客符合该规则,直接使用下方配置即可:
User-agent: * Disallow: /wp-admin/ Disallow: /blog/
规则说明
User-agent: *:代表所有搜索引擎爬虫都需要遵守下方的禁止爬取规则- 保留原有
Disallow: /wp-admin/规则,继续禁止爬虫访问站点后台路径 - 新增的
Disallow: /blog/规则,会禁止爬虫爬取https://snapvisibility.com/blog/路径下的所有子页面,覆盖全部博客内容 - 若你的案例研究内容也有统一路径前缀,比如
/case-study/,只需新增一行Disallow: /case-study/即可禁止对应内容被爬取
特殊情况处理
如果你的博客内容没有统一路径前缀,分散在根目录下,可以先通过WordPress后台固定链接设置为博客内容统一添加/blog/前缀,再使用上述配置;如果不方便修改路径,也可以配合页面级的noindex规则实现禁止收录的需求。
注意:robots.txt是搜索引擎爬虫自愿遵守的规则,恶意爬虫不会受其约束。如果要确保内容绝对不被公开收录,建议同时在对应页面的HTML头部添加
<meta name="robots" content="noindex">标签,或者在服务器返回响应头中添加X-Robots-Tag: noindex字段。
内容的提问来源于stack exchange,提问作者snapvisibility
相关产品推荐
相关产品推荐

