使用Selenium点击链接后无法获取新表格,求获取新页面的代码
解决Selenium点击链接后获取新页面表格的问题
嘿,我明白你的困扰啦!你点击链接后打开了新窗口,但还在使用原来页面的BeautifulSoup对象去查找表格,这当然拿不到新页面的内容呀。下面是具体的解决步骤和修改后的代码:
问题核心原因
你点击链接后,浏览器打开了一个新的窗口/标签页,但你的Selenium驱动还停留在原来的页面上下文,而且之前的soup对象是基于初始页面的HTML创建的,完全和新页面没关系。
修复后的完整代码
import pandas as pd from selenium import webdriver from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by import By from bs4 import BeautifulSoup df_list = [] # 初始化驱动 driver = webdriver.PhantomJS(executable_path='C:\\Python27\\phantomjs-2.1.1-windows\\bin\\phantomjs') driver.get('https://www.cartolafcbrasil.com.br/scouts/cartola-fc-2018/rodada-1') # 点击目标链接 driver.find_element_by_xpath("/html[1]/body[1]/form[1]/div[1]/div[2]/div[3]/div[1]/div[1]/div[2]/div[1]/div[1]/div[2]/div[1]/div[2]/div[1]/table[1]/tbody[1]/tr[52]/td[1]/table[1]/tbody[1]/tr[1]/td[2]/a[1]").click() # 1. 切换到新打开的窗口 # 获取所有窗口句柄,第一个是原窗口,第二个是新窗口 window_handles = driver.window_handles driver.switch_to.window(window_handles[1]) # 2. 等待新页面的表格加载完成(关键!避免页面未加载完就查找元素) # 这里等待表格标签出现,可根据实际情况调整等待时间和定位方式 WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.TAG_NAME, 'table')) ) # 3. 获取新页面的HTML并解析 new_page_html = driver.page_source soup = BeautifulSoup(new_page_html, 'html.parser') table = soup.find_all('table')[0] df = pd.read_html(str(table), encoding="UTF-8") # 后续处理数据,比如添加到列表 df_list.append(df) # 清理操作:关闭新窗口,切回原窗口(如果需要),最后退出驱动 driver.close() driver.switch_to.window(window_handles[0]) driver.quit()
关键步骤说明
- 切换窗口句柄:
driver.window_handles会返回当前所有窗口的句柄列表,点击链接后新窗口是列表的第二个元素(索引1),用switch_to.window切换到新页面上下文。 - 等待页面加载:用
WebDriverWait等待表格元素出现,确保页面完全加载后再解析,避免因网络延迟导致找不到元素的问题。 - 重新解析新页面:切换到新窗口后,必须重新获取页面的
page_source,再用BeautifulSoup处理,也可以直接用pd.read_html(driver.page_source)来更简洁地读取表格。
另外提一句:PhantomJS已经停止维护啦,如果你后续有版本升级需求,可以换成ChromeDriver或者FirefoxDriver,使用体验会更稳定哦~
内容的提问来源于stack exchange,提问作者Pedro
相关产品推荐
相关产品推荐

