使用Selenium提取class为iframe-b3的HTML表格并导出至Excel
提取B3网站投资者参与表格并导出到Excel的解决方案
核心问题分析
你当前的代码仅定位了iframe-b3元素,但目标表格嵌套在该iframe内部,Selenium默认处于主文档上下文,无法直接访问iframe里的内容,因此需要先切换到iframe再提取数据,最后导出到Excel。
完整实现代码
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC import pandas as pd # 初始化Chrome驱动(需确保chromedriver与浏览器版本匹配) driver = webdriver.Chrome() target_url = "https://www.b3.com.br/pt_br/market-data-e-indices/servicos-de-dados/market-data/consultas/boletim-diario/boletim-diario-do-mercado/" driver.get(target_url) # 等待iframe加载完成并切换上下文 wait = WebDriverWait(driver, 15) iframe = wait.until(EC.presence_of_element_located((By.CLASS_NAME, "iframe-b3"))) driver.switch_to.frame(iframe) # 定位目标表格(通过标题定位对应表格) table_header = wait.until(EC.presence_of_element_located((By.XPATH, "//h3[contains(text(), 'Tabela: Participação dos Investidores')]"))) target_table = table_header.find_element(By.XPATH, "./following-sibling::table") # 提取表格数据 table_rows = target_table.find_elements(By.TAG_NAME, "tr") table_data = [] for row in table_rows: # 区分表头(th标签)和数据行(td标签) cells = row.find_elements(By.TAG_NAME, "td") or row.find_elements(By.TAG_NAME, "th") row_content = [cell.text.strip() for cell in cells] if row_content: table_data.append(row_content) # 切回主文档并关闭浏览器 driver.switch_to.default_content() driver.quit() # 导出数据到Excel if table_data: df = pd.DataFrame(table_data[1:], columns=table_data[0]) df.to_excel("investidores_participacao.xlsx", index=False) print("数据已成功导出到Excel文件")
关键步骤说明
- 切换iframe上下文:这是核心前提,只有切换到
iframe-b3内部,才能定位到里面的表格元素。 - 显式等待:使用
WebDriverWait确保元素加载完成,避免因页面动态加载导致的元素未找到错误。 - 表格数据提取:分别处理表头(
<th>)和数据行(<td>),过滤空行后整理成二维列表。 - Excel导出:借助
pandas快速将数据写入Excel,自动处理表头和格式。
注意事项
- 确保浏览器驱动(如ChromeDriver)与你的浏览器版本完全匹配,否则会启动失败。
- 若页面加载缓慢,可适当调整等待时间(代码中设置的15秒)。
- 若网站结构更新,需调整XPATH定位表达式以匹配新的页面元素。
内容的提问来源于stack exchange,提问作者f_pro_97
相关产品推荐
相关产品推荐

