You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用UiPath抓取网页表格详情链接内的表格数据至Excel?

方案一:用Excel Power Query实现(无代码,直接集成Excel)
  • 抓取主表分页数据

    1. 打开Excel,选「数据」选项卡 →「自网站」,输入目标网页地址。
    2. 在导航器里找到主表格,加载进Power Query编辑器。
    3. 处理分页:如果分页是URL参数控制(比如?page=1),修改数据源URL,写个自定义函数循环遍历1-15页;如果是点击分页按钮,开启JavaScript渲染后用Web.Page函数模拟点击。
    4. 保留主表4列数据,同时把details列的链接提取出来,新增一列叫「详情链接」。
  • 批量抓取详情页表格

    1. 在Power Query里选中「详情链接」列,右键点「添加自定义列」,输入公式:
      Table.FromRecords(Web.Page(Web.Contents([详情链接])){0}[Data])
      
      (要是详情页的表格不是第一个,调整{0}的索引值就行)
    2. 展开自定义列里的所有字段,让主表和详情页数据对应上。
  • 加载到Excel
    调整好列顺序、数据类型后,点「关闭并上载」,数据就会同步到Excel工作表,之后还能刷新更新。

方案二:用Python实现(灵活适配复杂场景)

适合网页有反爬或动态渲染的情况,用到pandas、requests、playwright这些工具:

  • 抓取主表分页数据

    1. 分析分页逻辑:静态URL分页就循环构造page=1到page=15的请求;动态加载就用playwright模拟浏览器点分页按钮。
    2. 解析主表,把每一行的4列数据和details链接存到列表里。
  • 遍历详情链接抓数据

    1. 对每个详情链接发请求(或模拟点击),解析页面里的表格数据。
    2. 把主表数据和详情表数据合并成一条完整记录。
  • 导出到Excel
    用pandas整理好所有数据后导出:

    import pandas as pd
    # all_data是整理好的所有数据列表
    df = pd.DataFrame(all_data)
    df.to_excel("抓取结果.xlsx", index=False)
    
常见问题排查
  • Power Query加载不了动态内容:去「数据」→「获取数据」→「选项和设置」→「查询选项」里,开启「Web」下的「允许JavaScript」。
  • 详情页表格结构不一致:Power Query里加条件判断,或者Python用try-except处理异常。
  • 遇到反爬:Python里加请求头(User-Agent),或者用playwright模拟真实浏览器行为。

内容的提问来源于stack exchange,提问作者Shankar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 14:17:43