You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Beautiful Soup数据爬取:获取目标body节点失败求助

解决动态渲染页面的爬取问题

你遇到的核心问题是:requests只能获取服务器返回的静态HTML源码,而你在浏览器审查元素里看到的目标body,是页面加载后通过JavaScript动态生成的内容,所以静态源码里找不到。

方案一:用Selenium模拟浏览器渲染

Selenium可以模拟真实浏览器的加载过程,等待JavaScript执行完成后再获取渲染后的DOM。

步骤:

  1. 安装Selenium和对应浏览器的驱动(比如ChromeDriver,需匹配浏览器版本)
  2. 编写代码模拟浏览器访问、等待渲染、获取页面源码

示例代码:

from selenium import webdriver
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from bs4 import BeautifulSoup

url = "https://hereford.ttleagues.com/rankings/24018e59-6861-4082-bb62-5455224a3ad8"

# 初始化Chrome驱动(需提前下载对应版本的ChromeDriver并配置路径)
driver = webdriver.Chrome()
driver.get(url)

# 等待页面关键元素加载完成(这里以目标表格为例,可根据实际调整)
try:
    WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.TAG_NAME, "table"))
    )
finally:
    # 获取渲染后的完整页面源码
    rendered_html = driver.page_source
    driver.quit()

# 解析渲染后的源码,此时获取的body就是目标节点
doc = BeautifulSoup(rendered_html, "html.parser")
target_body = doc.find("body")

方案二:直接抓取数据接口(更高效)

动态页面的数据通常通过AJAX请求从后端接口获取,直接抓接口比模拟浏览器更高效:

  1. 打开浏览器F12,切换到「Network」面板
  2. 刷新页面,筛选「XHR」类型的请求
  3. 找到返回排名数据的接口(通常是JSON格式)
  4. 用requests直接请求该接口,无需处理页面渲染

示例代码(需替换为你找到的真实接口URL):

import requests

api_url = "替换为你抓包得到的真实数据接口URL"
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36"
}

response = requests.get(api_url, headers=headers)
data = response.json()
# 直接处理JSON格式的原始数据,比解析HTML更便捷

两种方案中,抓接口的方式性能更优,适合批量爬取;Selenium则适配更复杂的JS渲染场景。

内容的提问来源于stack exchange,提问作者Thomas_Goulding

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 17:15:46