You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何让pandas的read_html()忽略隐藏表格?

筛选带有show_table类的表格,排除隐藏表格

我需要把Interactive Brokers网站上的保证金要求表格读取为多个pandas DataFrame,但使用pd.read_html()时返回了41个表格,而网页实际只显示13个——那些多余的表格都嵌套在带有hide_table类的div中,比如BELFOX交易所的表格就属于这类,并未在网页上展示。我只想读取带有show_table类的表格,该如何实现?

原测试代码

import pandas as pd
url = 'https://www.interactivebrokers.co.uk/en/index.php?f=40539&hm=us&ex=us&rgt=0&rsk=1&pm=0&rst=101004010808010801'
all_tables = pd.read_html(url)
print("len(all_tables)=", len(all_tables))
print("all_tables[0]=\n", all_tables[0])

运行结果

len(all_tables)= 41
all_tables[0]=
   Exchange BELFOX  ... Short Overnight Maintenance
0          BELFOX  ...                       11250
[1 rows x 12 columns]

解决方案

pd.read_html()本身不支持直接按父元素的CSS类筛选表格,需要先借助BeautifulSoup预处理HTML,移除包含隐藏表格的元素,再读取表格:

  1. 先安装所需依赖(如果未安装):
pip install requests beautifulsoup4
  1. 处理代码示例:
import pandas as pd
import requests
from bs4 import BeautifulSoup

url = 'https://www.interactivebrokers.co.uk/en/index.php?f=40539&hm=us&ex=us&rgt=0&rsk=1&pm=0&rst=101004010808010801'

# 获取网页内容并解析
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

# 移除所有带hide_table类的div(包含隐藏表格)
for hide_div in soup.find_all('div', class_='hide_table'):
    hide_div.decompose()

# 从处理后的HTML中读取表格
filtered_tables = pd.read_html(str(soup))

# 验证结果
print(f"筛选后的表格数量: {len(filtered_tables)}")
print(filtered_tables[0])

说明

通过BeautifulSoup的decompose()方法删除所有包含隐藏表格的div,这样pd.read_html()就只会读取网页中实际显示的、嵌套在show_table类div里的表格,最终得到符合预期的13个表格。

内容的提问来源于stack exchange,提问作者user733733

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 05:40:21