Python Selenium提取div内label标签文本报错解决
报错根因
触发错误的核心原因是混淆了Selenium两个元素查找方法的返回值规则:
find_elements()(复数形式):返回所有匹配DOM节点的列表,哪怕匹配结果为空、仅匹配到1个节点,返回值都是list类型,list对象本身不存在.text属性,直接调用就会抛出你遇到的AttributeError。find_element()(单数形式):返回匹配到的第一个DOM节点的WebElement对象,只有这个类型的对象可以直接调用.text属性获取节点内的文本内容。
修正实现
根据你给出的页面结构,每个single-model容器内仅包含1个存储型号的label标签,直接把内层查找的find_elements换成单数形式即可,同时可以对提取到的文本做首尾空白裁剪,避免拿到多余的空格、换行符。
另外你原代码中先访问Google再跳转目标页的步骤是冗余的,可以直接删除。
修正后的可运行代码如下:
from selenium import webdriver import time from selenium.webdriver.common.by import By from webdriver_manager.chrome import ChromeDriverManager from selenium.webdriver.chrome.service import Service Brand = ["Apple"] model_name = [] driver = webdriver.Chrome(service=Service(ChromeDriverManager().install())) search_url="https://northladder.com/en/ae/electronics/laptop/apple" driver.get(search_url) # 滚动到页面底部加载全量内容 driver.execute_script("window.scrollTo(0, document.body.scrollHeight);") time.sleep(5) model_blocks = driver.find_elements(by=By.CLASS_NAME, value="single-model") for block in model_blocks: # 用单数find_element直接获取单个label元素对象 label = block.find_element(by=By.TAG_NAME, value="label") model_text = label.text.strip() model_name.append(model_text) print(model_text) # 提取完成后所有笔记本型号都会存储在model_name列表中
可选兼容写法
如果你不确定每个容器内label标签的数量,也可以保留find_elements写法,但需要多一层循环遍历拿到的label列表,逐个取元素对象再读取文本:
model_blocks = driver.find_elements(by=By.CLASS_NAME, value="single-model") for block in model_blocks: labels = block.find_elements(by=By.TAG_NAME, value="label") for label in labels: model_text = label.text.strip() if model_text: # 过滤空文本的无效节点 model_name.append(model_text) print(model_text)
注:你提供的示例HTML里闭合标签写为
</lable>属于拼写错误(正确闭合标签应为</label>),实际线上页面的标签拼写是正确的,不会影响代码运行。
内容的提问来源于stack exchange,提问作者user19303773
相关产品推荐
相关产品推荐

