使用Selenium WebDriver获取对应ProductID下dealTitle的重复问题排查
解决Selenium循环获取不同ProductID下dealTitle重复的问题
嘿,我看你遇到了循环遍历ProductID时,总是拿到同一个商品标题和URL的问题,这大概率是元素定位的写法出问题了。
先看你原来的代码:
arrow = driver.find_element_by_id(ProductID and 'dealTitle')
这里的ProductID and 'dealTitle'是Python的逻辑表达式,不是你想的“关联父ID和子ID”。只要ProductID是有效的非空字符串,这个表达式就会直接返回'dealTitle'——也就是说,你每次循环都在找页面上同一个id="dealTitle"的元素,自然会重复输出啦!
正确的解决思路
你需要先定位到每个ProductID对应的父元素,再在这个父元素的范围内查找它下面的dealTitle子元素,这样就能确保拿到当前ProductID对应的内容了。
方法1:先找父元素,再在内部定位子元素
这是最清晰的方式,先获取当前ProductID的容器,再在容器里找子元素:
# 遍历每个ProductID的循环内 parent_element = driver.find_element_by_id(ProductID) # 在父元素内部查找dealTitle,只会找这个容器下的子元素 arrow = parent_element.find_element_by_id('dealTitle') title = arrow.text url = arrow.get_attribute('href')
方法2:用XPath直接定位父元素下的子元素
如果你喜欢一步到位,可以用XPath直接指定父ID下的子ID:
arrow = driver.find_element_by_xpath(f"//*[@id='{ProductID}']//*[@id='dealTitle']")
额外优化建议
如果页面是动态加载的,循环时可能遇到元素还没加载完成的情况,建议加上显式等待,避免出现StaleElementReferenceException这类异常:
from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by import By # 假设product_id_list是你的ProductID列表 for product_id in product_id_list: # 等待当前ProductID的父元素加载完成 parent_element = WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.ID, product_id)) ) # 在父元素内等待dealTitle元素加载完成 arrow = WebDriverWait(parent_element, 10).until( EC.presence_of_element_located((By.ID, 'dealTitle')) ) title = arrow.text url = arrow.get_attribute('href') print(f"{product_id} {title} {url}")
这样修改后,你循环每个ProductID时,就能正确获取对应的dealTitle和URL了。
内容的提问来源于stack exchange,提问作者Jora_tontak
相关产品推荐
相关产品推荐

