You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Google Sheets IMPORTXML抓取改版Fundrise页面失效问题排查

故障原因
  • 核心问题是Fundrise这次改版后,项目详情页的核心统计数据全部改成JavaScript动态渲染加载,Google Sheets的IMPORTXML只能抓到服务器直接返回的初始静态HTML代码,没法运行页面里的JS,根本拿不到JS执行完才插到页面里的数值。
  • 你在浏览器开发者工具里复制的全路径XPath,对应的是JS加载完成后的最终页面结构,和IMPORTXML实际请求拿到的初始源码结构完全对不上。加上这次改版后站点给非浏览器的爬虫请求(包括Google Sheets自带的爬虫)加了拦截,很多时候只会返回没有实际数据的骨架屏,这种情况下不管怎么改XPath都匹配不到目标内容。
  • 之前的旧公式失效,是因为原来的statistic__value类名要么改了要么删了,要么对应的节点根本不在初始返回的HTML里。另外全路径XPath本身容错率极差,只要DOM多一层少一层、包裹div的顺序变了就直接失效,本来就不适合拿来做长期抓取规则。
调整方案
  • 先确认IMPORTXML实际能拿到的页面内容,在单元格输入下面的公式看返回结果:
=IMPORTXML("https://fundrise.com/offerings/8/view","//body")

如果返回的只有加载提示、骨架屏占位符,找不到你要的具体统计数值,就说明确实是动态渲染+反爬拦截的问题,再死磕XPath也没用。

  • 要是想留在Google Sheets里实现抓取,可以用Apps Script写自定义函数,配置上模拟真实浏览器的请求头发请求。如果初始源码里嵌了页面初始化用的JSON数据,可以直接匹配对应的script标签提取JSON里的字段,这种方式比匹配DOM节点稳定得多,不会因为前端改class、调DOM层级就失效。
  • 如果初始源码里根本没带目标数据,就得搭配支持JS渲染的抓取工具,拿到加载完成后的完整页面内容,再用XPath匹配对应数值就行。

内容的提问来源于stack exchange,提问作者xphrellis

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 05:36:23