You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

pandas用apply对每行执行pd.read_html出现ParserError如何解决?

错误原因

apply方法的运行逻辑和你写的parse函数逻辑不匹配:

  • data_json.json_data.apply(parse)调用时,每次传入parse函数的参数是json_data列的单个行值,也就是完整的HTML字符串,而非整个列的所有值集合。
  • 你在parse函数中额外加了for i in data的循环,相当于遍历单个HTML字符串的每一个字符,把单个字符传给pd.read_html()进行解析,自然会触发Document is empty的解析错误。
  • 你单独编写的遍历代码是直接迭代整个json_data列的所有值,每次传入pd.read_html的都是完整的HTML字符串,因此可以正常运行。
修复方案

两种实现方式均可达到预期效果:

方式1:简化parse函数(推荐)

去掉parse函数中多余的循环逻辑即可:

def parse(data):
    # 直接处理传入的单行HTML字符串
    statistics = pd.read_html(data)
    # 若确认每个HTML中只有1个目标表格,可返回statistics[0]直接拿到DataFrame,否则返回整个解析结果列表
    return statistics

data_json['table'] = data_json['json_data'].apply(parse)

如果需要兼容个别无效HTML的异常场景,可以加上异常捕获:

def parse(data):
    try:
        return pd.read_html(data)
    except:
        # 解析失败时返回空值或自定义的默认值
        return None

方式2:直接复用你已跑通的遍历逻辑

把遍历得到的结果直接赋值给新列即可:

table_statistics = []
for i in data_json.json_data.values:
     statistics = pd.read_html(i)
     table_statistics.append(statistics)
data_json['table'] = table_statistics

内容的提问来源于stack exchange,提问作者me.limes

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 18:36:00