You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python Requests提取HTML特定标签内容(以footer为例)

提取特定HTML标签内容的实现方法

完全可以实现,你需要借助HTML解析库来处理返回的页面内容,这里推荐使用BeautifulSoup,它能方便地定位和提取HTML元素。

步骤1:安装依赖库

首先需要安装BeautifulSoup4:

pip install beautifulsoup4

如果想使用解析速度更快的lxml解析器,也可以一并安装:

pip install lxml

步骤2:修改代码实现提取

替换你原来的代码为以下内容,注意把目标网站URL替换成实际地址:

import requests as req
from bs4 import BeautifulSoup

# 替换为目标网站的实际URL
target_url = "https://your-target-site.com"
resp = req.get(target_url)

# 解析HTML内容,这里用lxml解析器,也可以用内置的"html.parser"
soup = BeautifulSoup(resp.text, "lxml")

# 定位class为"footer"的footer标签
footer_element = soup.find("footer", class_="footer")

# 输出结果
if footer_element:
    # prettify()方法会格式化HTML输出,和你期望的格式一致
    print(footer_element.prettify())
else:
    print("页面中未找到指定的footer标签")

关键代码说明

  • soup.find("footer", class_="footer"):精准匹配<footer class="footer">标签,用class_是因为class是Python的关键字,避免语法冲突。
  • prettify():自动对HTML内容进行缩进格式化,让输出结构更清晰,和你给出的期望输出格式一致。
  • 如果页面存在多个符合条件的footer标签,可以改用soup.find_all()来获取所有匹配结果,再遍历输出:
footer_elements = soup.find_all("footer", class_="footer")
for elem in footer_elements:
    print(elem.prettify())

内容的提问来源于stack exchange,提问作者Ilya

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 05:20:28