谷歌表格IMPORTXML函数仅导入前10条标题,如何导入全部?
解决谷歌表格IMPORTXML仅导入前10条标题的问题
问题原因
目标网站的标题列表采用分页加载机制,IMPORTXML只能抓取页面首次加载的内容(也就是前10条),剩余标题需要翻页后才会加载到页面中。
解决方法
1. 批量导入多分页内容
该分类页的分页URL规律是在原链接末尾添加/page/N/(N为页码),比如第2页URL为https://erej.org/category/%d9%82%d8%b3%d9%85-%d8%a7%d9%84%d8%b9%d8%a8%d8%a7%d8%af%d8%a7%d8%aa/%d8%a8%d8%a7%d8%a8-%d8%a7%d9%84%d8%b7%d9%87%d8%a7%d8%b1%d8%a9/page/2/。可以用ARRAYFORMULA结合IMPORTXML批量抓取多页内容:
=ARRAYFORMULA(FLATTEN(IMPORTXML("https://erej.org/category/%d9%82%d8%b3%d9%85-%d8%a7%d9%84%d8%b9%d8%a8%d8%a7%d8%af%d8%a7%d8%aa/%d8%a8%d8%a7%d8%a8-%d8%a7%d9%84%d8%b7%d9%87%d8%a7%d8%b1%d8%a9/page/"&SEQUENCE(5)&"/","//h2")))
SEQUENCE(5)表示抓取前5页,可根据网站实际总页数调整数字;FLATTEN用于将多页的标题结果合并成一列,方便查看。
2. 尝试抓取网站API数据
打开浏览器开发者工具(按F12),切换到「网络」标签,滚动页面加载更多标题,观察是否有XHR类型的请求返回完整的标题列表。如果找到对应的API接口,可直接用IMPORTDATA导入,或安装IMPORTJSON自定义函数来获取数据,这种方式效率更高。
3. 规避反爬限制
批量抓取可能触发网站反爬机制,导致请求被拦截。建议不要一次性抓取过多页面,可分批次操作,避免频繁请求。
内容的提问来源于stack exchange,提问作者Mergen
相关产品推荐
相关产品推荐

