Python用Selenium+BeautifulSoup爬虫出现NoneType无get属性报错怎么解决
报错原因分析
- 报错的核心是
link.find('a')返回了None值,你直接对None调用get('href')方法,就触发了AttributeError。 - 常见的触发场景:
- 你筛选到的
div.product节点中,存在部分特殊节点(比如广告位、占位符、失效商品卡片),内部本身就没有标签 - 页面属于动态渲染,你设置的2秒固定等待时间不足,部分商品节点还没渲染完成就被提取给BeautifulSoup解析,导致节点结构缺失
- 也有可能是网站的节点规则有更新,
div.product下的链接标签结构和你预期不一致
- 你筛选到的
- 首先增加非空判断,避免报错直接中断程序,修改循环部分的代码:
for link in links: a_tag = link.find('a') # 同时判断a标签存在、且href属性有有效值再执行后续操作 if a_tag and a_tag.get('href'): anchor = a_tag.get('href') print(anchor) list_links.append(anchor)
- 其次优化页面等待逻辑,替换固定时间等待为显式等待,确保节点加载完成后再解析,示例修改如下:
# 先导入依赖 from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC driver = webdriver.Chrome() driver.get('https://www.basspro.com/shop/en/grills') driver.maximize_window() # 替换原来的time.sleep(2)为下面的显式等待逻辑,最长等待10秒,直到商品链接节点加载完成 wait = WebDriverWait(driver, 10) wait.until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, 'div.product a'))) content = driver.page_source soup = BeautifulSoup(content,'html.parser')
- 如果修改后还是取不到部分链接,可以打印单个
link的HTML内容,确认div.product节点的结构是否符合预期,必要时调整find_all的筛选条件,缩小选择范围到有效商品卡片。
内容的提问来源于stack exchange,提问作者Thinesh
相关产品推荐
相关产品推荐

