使用Python Selenium爬取剑桥词典,获取MP3下载链接遇阻求助
解决剑桥词典音频MP3链接获取问题
嘿,我猜你踩的坑是剑桥词典的音频播放按钮根本没把MP3链接放在href里!这类词典网站的音频按钮大多用自定义的data属性存链接,靠JavaScript触发播放,所以用.get_attribute("href")肯定拿不到,.text更是只能拿到按钮上的空文本(毕竟是个喇叭图标)。
下面给你具体的解决思路和代码:
1. 先搞清楚音频链接存在哪个属性里
打开浏览器开发者工具,检查你定位到的音频按钮元素,会发现它的HTML结构大概是这样:
<button class="audio_play_button us" data-src-mp3="https://cdn.dictionaryapi.com/media/pron/en/us/mp3/h/hun/hunch_us_1.mp3">
看到没?data-src-mp3这个自定义属性才是存MP3链接的地方!
2. 修改Selenium代码获取正确属性
把原来的.text或.get_attribute("href")换成.get_attribute("data-src-mp3"),再加上显式等待确保元素加载完成,完整代码如下:
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC words = ['hunch'] base_link = 'https://dictionary.cambridge.org/dictionary/english-polish' driver = webdriver.Chrome() wait = WebDriverWait(driver, 10) # 显式等待10秒,避免页面未加载完就操作 try: for word in words: driver.get(f"{base_link}/{word}") # 定位美式发音按钮(要英式的话,把XPath里的"us"改成"uk"就行) audio_button = wait.until( EC.presence_of_element_located( (By.XPATH, '//button[contains(@class, "audio_play_button") and contains(@class, "us")]') ) ) # 提取MP3链接 mp3_url = audio_button.get_attribute("data-src-mp3") print(f"单词 {word} 的美式发音MP3链接: {mp3_url}") finally: driver.quit()
3. 额外提醒
- 一定要用显式等待:剑桥词典页面加载可能有延迟,直接定位元素容易报错,
WebDriverWait能确保元素渲染完成后再操作。 - 区分发音版本:如果需要英式发音,只要把XPath里的
contains(@class, "us")改成contains(@class, "uk")即可。 - 极端情况:如果遇到元素在shadow DOM里(这种情况很少见),还需要额外处理shadow DOM的定位逻辑,但剑桥词典一般不会这么搞。
内容的提问来源于stack exchange,提问作者Szymo n
相关产品推荐
相关产品推荐

