robots.txt的作用:禁止文件后是否会阻止其出现在搜索结果?
robots.txt的Disallow指令能否阻止文件被列为搜索结果?
不一定,需分场景判断:
- 常规场景:合规爬虫会遵守Disallow指令不抓取该文件内容,但如果该文件曾被抓取过、或是被非合规爬虫爬取后提交给搜索引擎,它仍可能出现在搜索结果中——只是可能没有内容摘要,或摘要显示该页面无法访问。
- 搜索引擎主动处理场景:部分搜索引擎会依据robots.txt的Disallow规则,主动将该文件从搜索结果中移除,但这并非所有搜索引擎的统一标准,且前提是搜索引擎未通过其他渠道获取到该文件的存在信息。
- 更彻底的屏蔽方式:如果想确保文件完全不出现在搜索结果里,仅靠robots.txt的Disallow不够,还可以在文件的HTML代码中添加
meta name="robots" content="noindex"标签,或是通过对应搜索引擎的站长工具提交移除请求,这些方法的效果更直接可靠。
内容的提问来源于stack exchange,提问作者John Hodgson
相关产品推荐
相关产品推荐

