You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Python Selenium爬取剑桥词典,获取MP3下载链接遇阻求助

解决剑桥词典音频MP3链接获取问题

嘿,我猜你踩的坑是剑桥词典的音频播放按钮根本没把MP3链接放在href里!这类词典网站的音频按钮大多用自定义的data属性存链接,靠JavaScript触发播放,所以用.get_attribute("href")肯定拿不到,.text更是只能拿到按钮上的空文本(毕竟是个喇叭图标)。

下面给你具体的解决思路和代码:

1. 先搞清楚音频链接存在哪个属性里

打开浏览器开发者工具,检查你定位到的音频按钮元素,会发现它的HTML结构大概是这样:

<button class="audio_play_button us" data-src-mp3="https://cdn.dictionaryapi.com/media/pron/en/us/mp3/h/hun/hunch_us_1.mp3">

看到没?data-src-mp3这个自定义属性才是存MP3链接的地方!

2. 修改Selenium代码获取正确属性

把原来的.text或.get_attribute("href")换成.get_attribute("data-src-mp3"),再加上显式等待确保元素加载完成,完整代码如下:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

words = ['hunch']
base_link = 'https://dictionary.cambridge.org/dictionary/english-polish'

driver = webdriver.Chrome()
wait = WebDriverWait(driver, 10)  # 显式等待10秒,避免页面未加载完就操作

try:
    for word in words:
        driver.get(f"{base_link}/{word}")
        # 定位美式发音按钮(要英式的话,把XPath里的"us"改成"uk"就行)
        audio_button = wait.until(
            EC.presence_of_element_located(
                (By.XPATH, '//button[contains(@class, "audio_play_button") and contains(@class, "us")]')
            )
        )
        # 提取MP3链接
        mp3_url = audio_button.get_attribute("data-src-mp3")
        print(f"单词 {word} 的美式发音MP3链接: {mp3_url}")
finally:
    driver.quit()

3. 额外提醒

  • 一定要用显式等待:剑桥词典页面加载可能有延迟,直接定位元素容易报错,WebDriverWait能确保元素渲染完成后再操作。
  • 区分发音版本:如果需要英式发音,只要把XPath里的contains(@class, "us")改成contains(@class, "uk")即可。
  • 极端情况:如果遇到元素在shadow DOM里(这种情况很少见),还需要额外处理shadow DOM的定位逻辑,但剑桥词典一般不会这么搞。

内容的提问来源于stack exchange,提问作者Szymo n

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 07:54:22