You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何我的Python网页爬虫无法提取目标网页的Transcript内容?

解决网页抓取Transcript内容失败的问题

可能的原因

  • 目标内容是动态加载的:requests获取的是服务器返回的原始HTML,而浏览器中看到的span[data-id='itemText']可能是页面加载后通过JavaScript渲染生成的,原始HTML里根本没有这个元素。
  • 元素选择器匹配错误:可能实际元素标签或属性值和你在浏览器检查里看到的有差异。

解决方法

方法1:先验证原始HTML中是否存在目标元素

先打印获取到的原始HTML内容,确认目标元素是否存在:

from bs4 import BeautifulSoup
import requests

url = "https://cdm20045.contentdm.oclc.org/digital/collection/p20045coll17/id/1417/rec/4"
html = requests.get(url, verify=False)

# 打印前5000个字符查看原始HTML内容
print(html.text[:5000])

如果输出里找不到data-id="itemText"的元素,说明是动态加载问题,需要用浏览器渲染工具。

方法2:使用Selenium模拟浏览器渲染

Selenium会模拟真实浏览器加载页面,能获取到JavaScript渲染后的内容:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

url = "https://cdm20045.contentdm.oclc.org/digital/collection/p20045coll17/id/1417/rec/4"

# 初始化浏览器(这里用Chrome,需要提前安装ChromeDriver)
driver = webdriver.Chrome()
driver.get(url)

# 等待目标元素加载完成
try:
    # 等待span元素出现,最多等10秒
    item = WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.CSS_SELECTOR, "span[data-id='itemText']"))
    )
    # 提取文本内容
    transcript_text = item.text
    print(transcript_text)
finally:
    driver.quit()

方法3:检查API接口

有些动态加载的内容是通过AJAX请求获取的,可以打开浏览器的开发者工具-网络-XHR,刷新页面后查找加载Transcript内容的API接口,直接请求接口获取数据,这种方式比Selenium更高效。

内容的提问来源于stack exchange,提问作者tgallavich

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 10:50:25