爬虫真的会设置Referer URL吗?实际观测引发的技术疑问
爬虫居然会带Referer?实际观测打破了我的固有认知
嘿,我之前一直凭着看过的资料,想当然地认为爬虫根本不会设置Referer URL,但最近的实际观测结果直接打了我的脸——当然,也可能是不同爬虫场景下的行为差异导致的。
我们这边是通过一段JavaScript代码来调用后端接口的:
<script>aCallToToWebApiEndAndUpdateDom(params)</script>
这个接口的作用是创建用户会话、统计访问量,同时会记录请求里的UserAgent和urlReferrer两个字段。
结果近期在日志里翻到了一条有意思的记录:这条请求的urlReferrer是用户实际访问的页面地址,而UserAgent显示的是Mozilla/5.0 (compatible; Googl...——明眼人一看就知道这是谷歌系爬虫的标识。
这说明现在不少主流爬虫(尤其是搜索引擎的爬虫)已经开始模拟正常浏览器的请求逻辑了,不再是早期那种完全不带请求头的"裸奔"状态,会主动携带Referer这类常见请求头来伪装得更像真实用户请求。
内容的提问来源于stack exchange,提问作者rethabile
相关产品推荐
相关产品推荐

