该robots.txt文件是否允许Googlebot抓取我的网站?
关于Googlebot抓取权限的判断
先解析你提供的robots.txt规则:
- 第一行单独的
Disallow: /属于无效规则,因缺少对应的User-agent标识,搜索引擎会直接忽略。 - 针对
Robozilla爬虫,规则为Disallow: /,禁止其抓取全站内容。 - 针对包括Googlebot在内的所有其他爬虫,
User-agent: *对应的规则是:Disallow:(空值)表示允许抓取网站的大部分内容Disallow: /cgi-bin/明确禁止抓取/cgi-bin/目录下的内容
结论:Googlebot被允许抓取你网站除/cgi-bin/目录外的所有内容。
内容的提问来源于stack exchange,提问作者Stream Koyal
相关产品推荐
相关产品推荐

