为何Google Cache(谷歌缓存)有时会包含多个HTML请求?
谷歌缓存包含多个HTML文件的产生原因
- 谷歌缓存附加结构拆分统计
谷歌返回缓存页面时,会默认在原始页面内容外插入自带的缓存导航栏、快照时间提示等独立HTML片段,部分浏览器的请求统计工具会将这部分附加HTML和原始页面的HTML识别为两个独立的HTML请求,这是最常见的成因。你示例链接中使用的strip=0参数代表保留所有谷歌附加内容,如果修改为strip=1仅返回纯原始页面内容,就不会出现该类多HTML请求的情况。 - 页面重定向的多快照留存
如果谷歌爬虫抓取目标页面时,目标页面存在301/302等跳转逻辑,谷歌会同时留存跳转前的初始页面快照、跳转后的最终页面快照,访问缓存时两个快照的HTML会先后加载,对应两条独立的HTML请求。 - 原始页面的iframe嵌套
如果被缓存的原始页面本身嵌入了同域名的HTML iframe,谷歌爬虫会同步抓取主页面和iframe的内容并共同缓存,访问缓存时两类HTML内容会同时被加载,也会产生多个HTML请求计数。
内容的提问来源于stack exchange,提问作者Terry Riegel
相关产品推荐
相关产品推荐

