You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

investorscout站点数据加载逻辑查询及requests+bs4爬取方案问询

该站点数据爬取实现思路

第一步:优先排查静态嵌入数据

绝大多数未在XHR/Fetch分类中暴露接口的首屏数据,都是服务端直接嵌入到返回的HTML源码中的,你可以按以下步骤操作:

  • 用requests发送GET请求获取页面完整源码,请求头要完全模拟浏览器,至少携带User-Agent、Referer字段,和浏览器请求时的Cookie值,避免被反爬拦截返回空页面
  • 用bs4匹配页面中所有<script>标签,筛选type="application/json"的标签,或者直接在所有script标签的内容中搜索你需要的目标数据关键字(比如投资者名称、基金规模这类字段)
  • 绝大多数站点会把首屏数据存在window.__INITIAL_STATE__、window.__NEXT_DATA__这类全局变量中,找到对应内容后提取JSON字符串,直接用json库解析即可拿到结构化数据,不需要额外抓接口

第二步:排查网络请求捕获遗漏问题

如果第一步没有找到嵌入数据,先确认你抓包的操作是正确的:

  • 打开开发者工具的Network面板后,先勾选「Preserve log(保留日志)」选项,避免页面跳转、重定向时清空请求日志
  • 取消所有请求类型过滤,不要只看XHR/Fetch分类,doc、js、其他类别的请求都要排查,部分站点会把数据打包到入口JS文件中,或者用不标准的请求类型返回数据
  • 可以用搜索功能直接在整个Network面板的所有请求响应中搜索目标数据关键字,快速定位数据所在的请求

第三步:特殊场景适配

如果以上两步都没有找到数据,可以按以下情况排查:

  • 部分站点用GraphQL接口返回数据,这类请求的请求体是结构化JSON,你可以在Network面板搜索graphql关键字定位对应请求,直接模拟请求体发送POST请求即可拿到数据
  • 如果确认数据是纯客户端JS动态计算生成,没有发起额外请求,requests+bs4方案无法支持,需要更换为带JS渲染的工具(比如Playwright、Selenium)实现爬取

内容的提问来源于stack exchange,提问作者Ayyan Khan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 11:48:03