如何用Python自动化将HTML数据导入Excel的报表生成流程?
Python自动化处理HTML转Excel入门指南
1. 环境准备
- 安装Python:下载对应系统的Python安装包,勾选"Add Python to PATH"选项完成安装。
- 安装所需库:打开命令提示符(Windows)或终端(Mac/Linux),执行以下命令:
pip install pandas openpyxlpandas:负责读取HTML文件中的表格数据openpyxl:负责写入和操作Excel文件
2. 文件准备
- 将需要处理的两个HTML文件(例如命名为
data1.html、data2.html)与Python脚本放在同一文件夹,或记录它们的绝对路径(如C:/reports/data1.html)。 - 确定目标Excel文件路径(如
绩效报表.xlsx),文件不存在时脚本会自动创建。
3. 编写自动化脚本
新建文本文件并重命名为auto_report.py,粘贴以下代码后,根据实际文件路径修改:
import pandas as pd # 读取第一个HTML文件的表格数据,index=0表示取页面内第一个表格 df1 = pd.read_html("data1.html")[0] # 读取第二个HTML文件的表格数据 df2 = pd.read_html("data2.html")[0] # 初始化Excel写入对象,mode='a'为追加模式,if_sheet_exists='replace'覆盖已有工作表 with pd.ExcelWriter("绩效报表.xlsx", engine="openpyxl", mode='a', if_sheet_exists='replace') as writer: # 将数据写入工作表1,index=False不保留pandas默认索引列 df1.to_excel(writer, sheet_name="工作表1", index=False) # 将数据写入工作表2 df2.to_excel(writer, sheet_name="工作表2", index=False)
4. 运行脚本
- 打开命令提示符/终端,切换到脚本所在文件夹,执行:
python auto_report.py - 也可直接用VS Code、PyCharm等Python IDE打开脚本,点击运行按钮执行。
5. 进阶:定时自动执行
若需每30分钟自动运行脚本:
- Windows:打开「任务计划程序」,创建基本任务,设置触发频率为每30分钟,操作选择启动程序,程序路径选Python的exe文件,添加参数为脚本绝对路径(如
C:/scripts/auto_report.py)。 - Mac/Linux:执行
crontab -e,添加一行(替换为你的Python和脚本路径):*/30 * * * * /usr/bin/python3 /Users/yourname/scripts/auto_report.py
常见问题
- HTML读取失败:检查HTML文件的
<table>标签是否规范,可尝试添加header=0参数指定表头行(如pd.read_html("data1.html", header=0))。 - 权限报错:确保脚本拥有读取HTML文件和写入Excel文件的权限。
内容的提问来源于stack exchange,提问作者lessa developer
相关产品推荐
相关产品推荐

