You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

lxml.etree解析TED转录页HTML返回空树,XPath查询失效求助

TED演讲爬虫解析问题的解决方案

问题原因

  • TED官网的转录内容采用动态加载机制,直接通过requests.get()获取的HTML仅包含页面基础框架,实际转录文本并未在初始请求中返回,因此解析后的DOM树中没有目标内容,导致tree.text为空、XPath查询返回空列表。

解决方法

方法1:模拟浏览器加载动态内容(推荐)

使用浏览器自动化工具模拟页面加载,等待动态内容渲染完成后再提取HTML:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import lxml.etree as ET

link = 'https://www.ted.com/talks/ted_countdown_how_do_we_get_the_world_off_fossil_fuels_quickly_and_fairly/transcript'

# 初始化Chrome浏览器(需提前安装对应版本的ChromeDriver)
driver = webdriver.Chrome()
driver.get(link)

# 等待转录内容容器加载完成
wait = WebDriverWait(driver, 10)
wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '[data-testid="transcript-body"]')))

# 获取完整渲染后的页面源码
page_source = driver.page_source
driver.quit()

# 解析并提取转录文本
tree = ET.HTML(page_source)
transcript_content = tree.xpath('//*[@data-testid="transcript-body"]//text()')
print('\n'.join(transcript_content))

方法2:调用TED官方API获取结构化数据

直接请求TED的转录API接口,无需解析HTML即可拿到标准化的转录内容:

import requests

# 从演讲链接中提取slug部分
talk_slug = 'ted_countdown_how_do_we_get_the_world_off_fossil_fuels_quickly_and_fairly'
api_url = f'https://www.ted.com/talks/{talk_slug}/transcript.json'

# 发起请求(建议添加User-Agent避免拦截)
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'
}
response = requests.get(api_url, headers=headers)
transcript_data = response.json()

# 遍历输出转录文本
for paragraph in transcript_data['paragraphs']:
    print(paragraph['text'])

注意事项

  • 所有请求建议添加User-Agent请求头,模拟真实浏览器行为,降低被反爬机制拦截的概率。
  • 使用selenium时,需确保浏览器驱动版本与本地浏览器版本匹配。

内容的提问来源于stack exchange,提问作者Sebewe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 22:27:49