You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python Selenium抓取dvm360新闻提前关闭无数据返回问题求助

问题根因分析
  • 核心原因是原代码的元素定位逻辑失效:你使用find_elements_by_class_name('title')查找元素,要么是页面实际渲染后该类名对应的元素并非新闻头条的载体,要么是Selenium旧版本的定位API不稳定导致未匹配到任何元素,最终返回空列表。
  • 终端输出的Chrome蓝牙、USB、默认浏览器检测类错误日志和抓取失败无关,这是Chrome启动时本地硬件检测抛出的异常,不影响爬虫核心逻辑执行。
  • 后续修改后出现的something went wrong报错,是因为部分匹配到的标题类元素下没有内嵌<a>标签,执行查找子元素逻辑时抛出异常被捕获后输出的提示。
修复方案
    1. 替换已废弃的旧版Selenium定位API:Selenium 4.3+版本已经移除了find_elements_by_class_name这类写法,统一替换为find_elements(By.CLASS_NAME, "类名")的格式,避免API兼容问题导致定位失效。
    1. 优化元素定位逻辑:直接使用CSS选择器或XPath定位标题对应的<a>元素,减少层级查找的异常概率,示例写法为browser.find_elements(By.CSS_SELECTOR, ".title a"),可直接获取所有标题链接元素。
    1. 替换硬等待为显式等待:将time.sleep(20)替换为显式等待逻辑,等待目标元素加载完成后再执行抓取,既可以节省等待时间也能避免页面未加载完成就执行查找的问题,示例写法如下:
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By

# 等待标题链接元素加载,最长等待20秒
headlines = WebDriverWait(browser, 20).until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, ".title a")))
url_headlines = [ele.get_attribute('href') for ele in headlines]
    1. 屏蔽Chrome无关错误日志:初始化Chrome时添加启动参数即可屏蔽硬件检测类的报错,示例配置如下:
from selenium.webdriver.chrome.options import Options

options = Options()
options.add_argument('--log-level=3')
options.add_experimental_option('excludeSwitches', ['enable-logging'])
browser = webdriver.Chrome(options=options)
    1. 增加异常捕获逻辑:遍历元素时增加try-except捕获,单个元素抓取失败时直接跳过,避免中断整个列表的抓取流程。

内容的提问来源于stack exchange,提问作者technophile_3

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 14:06:04