You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Python Flask服务端提取HTML文件中的指定文本数据?

在Flask中提取HTML文件里的指定内容

嘿,这事儿不难,咱们用Flask结合HTML解析库就能搞定,具体步骤如下:

1. 安装必要的依赖

首先确保你装了Flask和用于解析HTML的BeautifulSoup4,打开终端运行:

pip install flask beautifulsoup4

2. 编写Flask代码

假设你的HTML文件名为index.html,内容就是你给出的示例。接下来创建Flask的主文件(比如app.py),代码如下:

from flask import Flask
from bs4 import BeautifulSoup

app = Flask(__name__)

@app.route('/')
def extract_welcome_content():
    # 读取本地HTML文件的内容
    with open('index.html', 'r', encoding='utf-8') as html_file:
        html_content = html_file.read()
    
    # 用BeautifulSoup解析HTML结构
    soup = BeautifulSoup(html_content, 'html.parser')
    
    # 定位到h1标签并提取文本内容
    welcome_text = soup.find('h1').text.strip()
    
    # 这里可以直接返回提取到的内容,也可以传递给模板渲染
    return f"从HTML中提取到的内容:*{welcome_text}*"

if __name__ == '__main__':
    app.run(debug=True)

代码说明

  • 我们用open()读取本地HTML文件,把内容转换成字符串供解析使用。
  • BeautifulSoup是专门用来解析HTML/XML的工具,这里用Python内置的html.parser作为解析器,不需要额外安装其他解析器。
  • soup.find('h1')会找到HTML中第一个<h1>标签,.text用来获取标签内的纯文本,strip()则是去除文本前后可能存在的空格、换行符等冗余内容。
  • 最后你可以选择直接返回提取到的内容,或者把它传给Flask模板进行更美观的展示。

内容的提问来源于stack exchange,提问作者sharath thota

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 07:09:53