Selenium爬取YouTube频道视频无法获取href属性问题
问题原因及解决方案
是的,YouTube确实更新了页面结构,导致你之前的代码失效。一年前video-title元素本身是带href属性的链接标签,现在它已经变成了纯文本展示的<yt-formatted-string>元素,真正的视频链接属性href移到了它的父级<a>标签上。
可行的解决方法
方法一:直接定位视频链接的a标签
现在YouTube的视频链接统一在id="video-title-link"的a标签上,直接定位这个元素就能获取href:
# Scrape for videos # WARNING: Takes very long from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC HOME = "https://www.youtube.com/user/theneedledrop/videos" driver = webdriver.Chrome("C:\webdriver\chromedriver.exe") driver.get(HOME) scroll() # 你的滚动加载函数 # 等待元素加载完成,避免找不到元素 WebDriverWait(driver, 15).until( EC.presence_of_element_located((By.ID, "video-title-link")) ) video_links = driver.find_elements(By.ID, "video-title-link") for link in video_links: video_href = link.get_attribute("href") video_title = link.find_element(By.ID, "video-title").text print(f"视频标题: {video_title}\n视频链接: {video_href}\n")
方法二:基于原定位的video-title元素获取父级链接
如果你想保留原来定位video-title的逻辑,可以通过元素的父节点找到对应的a标签:
element_titles = driver.find_elements(By.ID,"video-title") for title_elem in element_titles: # 找到父级的a标签 link_elem = title_elem.find_element(By.XPATH, "./parent::a") video_href = link_elem.get_attribute("href") video_title = title_elem.text print(f"视频标题: {video_title}\n视频链接: {video_href}\n")
方法三:通过video-id拼接链接
如果遇到a标签的href也被隐藏的情况,可以获取视频的data-video-id属性,手动拼接成完整链接:
# 定位每个视频的容器元素 video_containers = driver.find_elements(By.TAG_NAME, "ytd-rich-grid-media") for container in video_containers: video_id = container.get_attribute("data-video-id") video_href = f"https://www.youtube.com/watch?v={video_id}" video_title = container.find_element(By.ID, "video-title").text print(f"视频标题: {video_title}\n视频链接: {video_href}\n")
额外提示
YouTube的前端结构会频繁更新,建议使用显式等待(WebDriverWait)替代直接查找元素,避免因页面未加载完成导致的元素定位失败;同时注意不要过度频繁爬取,避免触发YouTube的反爬机制。
内容的提问来源于stack exchange,提问作者TheBeef
相关产品推荐
相关产品推荐

