You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium触发页面后,如何用pd.read_html读取当前页面?

解决Selenium点击后用pd.read_html读取页面表格的问题

你可以通过以下两种方式,在点击按钮获取渲染后的页面后直接读取表格,避免传入不完整的HTML字符串导致报错:

方法一:获取当前页面完整渲染后的HTML源码

点击按钮并等待表格加载完成后,直接获取浏览器当前的页面源码(包含动态渲染的表格),再传给pd.read_html()解析:

from selenium import webdriver
import pandas as pd
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

# 初始化驱动(以Chrome为例)
driver = webdriver.Chrome()
driver.get("目标页面URL")

# 等待按钮可点击并点击(根据实际按钮定位方式修改)
show_table_btn = WebDriverWait(driver, 10).until(
    EC.element_to_be_clickable((By.XPATH, "//button[contains(text(), '显示表格')]"))
)
show_table_btn.click()

# 等待表格加载完成(确保表格元素已出现在DOM中)
WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.TAG_NAME, "table"))
)

# 获取当前页面的完整渲染后HTML
page_source = driver.page_source

# 解析页面中的所有表格
tables = pd.read_html(page_source)

# 输出第一个表格(可根据实际情况调整索引)
print(tables[0])

driver.quit()

方法二:精准定位目标表格并获取其HTML

如果页面存在多个表格,或只想解析特定表格,可以直接定位到目标表格元素,获取它的完整HTML后再解析,减少干扰:

# (前面初始化、点击按钮、等待表格加载的代码和方法一一致)

# 定位到目标表格(示例用ID定位,可换成XPath、Class等)
target_table = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.ID, "table_id"))
)

# 获取表格的完整HTML代码
table_html = target_table.get_attribute("outerHTML")

# 解析该表格
tables = pd.read_html(table_html)
print(tables[0])

driver.quit()

关键注意事项

  • 必须等待表格加载完成后再获取HTML:点击按钮后表格可能是异步加载的,直接获取源码会导致表格未渲染,pd.read_html()找不到有效表格而报错。用WebDriverWait显式等待是最可靠的方式。
  • 避免使用点击前的页面源码:如果之前传入的html_string是点击按钮前的页面代码,自然不包含表格,导致解析失败。

内容的提问来源于stack exchange,提问作者user19795989

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 13:55:23