如何使用Python抓取网站文本数据并存储为Excel文件同时统计记录数
实现方案
你当前抓取的目标是纯文本格式的数据集,用BeautifulSoup解析纯文本属于冗余操作,直接处理请求返回的原始文本即可,以下是完整实现步骤:
1. 安装依赖包
导出Excel需要用到pandas做数据处理、openpyxl做Excel写入引擎,执行以下命令安装:pip install pandas openpyxl
2. 完整可运行代码
import requests import pandas as pd # 目标地址 URL = "https://www.bis.doc.gov/dpl/dpl.txt" # 发起请求 resp = requests.get(URL) # 按换行拆分所有行,过滤掉空行 lines = [line.strip() for line in resp.text.splitlines() if line.strip()] # 第一行是表头,用|分隔 headers = lines[0].split("|") # 处理后续数据行 data = [] for line in lines[1:]: row = line.split("|") # 对齐字段长度,避免部分行字段缺失报错 if len(row) == len(headers): data.append(row) # 转成DataFrame结构 df = pd.DataFrame(data, columns=headers) # 导出为Excel文件 df.to_excel("dpl_data.xlsx", index=False, engine="openpyxl") # 统计记录条数 print(f"总记录条数:{len(df)}")
代码说明
- 先对返回的文本按换行符拆分,过滤无意义的空行
- 该数据集以
|作为字段分隔符,拆分后对齐表头生成结构化数据 - 导出Excel时设置
index=False避免导出多余的行号列 - 记录条数直接取DataFrame的长度即可,自动排除了表头行
内容的提问来源于stack exchange,提问作者Raja Manikam
相关产品推荐
相关产品推荐

