孤立页面是否需要在robots.txt中设置规则禁止搜索引擎爬虫爬取
孤立页面防搜索引擎收录操作说明
仅从sitemap.xml中排除该页面不足以完全避免被搜索引擎收录,建议你同时将该URL添加到robots.txt中设置禁止爬取,最好再补充额外的防护配置,原因和具体建议如下:
- sitemap只是搜索引擎发现站点页面的渠道之一,即使你没有将该页面加入sitemap,如果有外部公开站点引用了这个链接、有用户将链接发布到了公开平台,或是爬虫进行随机路径遍历,都有可能发现该页面的存在,排除sitemap仅能切断这一个发现路径。
- robots.txt的Disallow规则可以主动告知所有合规的搜索引擎爬虫不要请求该页面,从爬取环节就进行拦截,是比单纯排除sitemap更主动的防护手段。
- 要注意robots.txt仅能阻止爬虫爬取页面内容,如果该链接已经被公开引用,部分搜索引擎仍可能将空白的URL条目展示在搜索结果中。如果要完全避免该页面出现在任何搜索结果里,更稳妥的做法是在页面的
<head>标签中添加<meta name="robots" content="noindex, nofollow">元标记,该规则会被爬取页面的爬虫识别,直接要求搜索引擎不将该页面纳入索引,也不追踪页面内的任何链接,防护效果更彻底。 - 如果该页面的涉密性较高,还可以给页面增加专属的访问校验逻辑,比如只有携带邮件中下发的有效校验参数的请求才能正常访问页面,即使爬虫拿到了链接也无法获取页面内容,进一步降低泄露风险。
内容的提问来源于stack exchange,提问作者Kamal Kishor
相关产品推荐
相关产品推荐

