You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

网页爬取异常:抓取的HTML与浏览器审查元素不一致,返回错误内容

问题原因分析

核心原因:客户端渲染(CSR)+ 初始占位内容

  • 前端路由与动态渲染:该网站的公司详情页采用前端路由机制,服务器返回的初始HTML是通用模板,内置了SpaceX内容作为加载占位。浏览器加载页面后,会执行JavaScript代码,根据URL中的路径(如/company/figma/)动态请求对应公司的数据,并替换掉初始的占位内容。而requests库仅能获取服务器返回的初始HTML,不会执行后续的JavaScript,因此始终拿到SpaceX的内容。
  • 浏览器加载的视觉表现:你在浏览器中看到的“短暂显示SpaceX再切换”,正是初始占位内容被JS动态替换的过程,这也验证了页面内容是由前端JS渲染生成的,而非服务器直接返回对应公司的完整HTML。

其他可能的辅助因素

  • 部分CSR站点会依赖Cookie或会话状态,但从你的测试情况来看,这并非主要原因,核心还是JS渲染的问题。
解决方案思路
  1. 使用无头浏览器工具:改用selenium、playwright或pyppeteer这类能模拟浏览器行为的库,它们会等待页面JS执行完成后再抓取最终渲染的HTML,就能获取到目标公司的信息。
  2. 直接请求后端API:通过浏览器开发者工具的Network面板,刷新目标页面,筛选XHR/Fetch请求,找到前端获取公司数据的API接口,直接请求该接口获取结构化的JSON数据,这种方式比爬取HTML更高效可靠。

内容的提问来源于stack exchange,提问作者Harvest Walukow

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.26 12:43:19