You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python抓取网站文本数据并存储为Excel文件同时统计记录数

实现方案

你当前抓取的目标是纯文本格式的数据集,用BeautifulSoup解析纯文本属于冗余操作,直接处理请求返回的原始文本即可,以下是完整实现步骤:

1. 安装依赖包

导出Excel需要用到pandas做数据处理、openpyxl做Excel写入引擎,执行以下命令安装:
pip install pandas openpyxl

2. 完整可运行代码

import requests
import pandas as pd

# 目标地址
URL = "https://www.bis.doc.gov/dpl/dpl.txt"
# 发起请求
resp = requests.get(URL)
# 按换行拆分所有行,过滤掉空行
lines = [line.strip() for line in resp.text.splitlines() if line.strip()]
# 第一行是表头,用|分隔
headers = lines[0].split("|")
# 处理后续数据行
data = []
for line in lines[1:]:
    row = line.split("|")
    # 对齐字段长度,避免部分行字段缺失报错
    if len(row) == len(headers):
        data.append(row)

# 转成DataFrame结构
df = pd.DataFrame(data, columns=headers)

# 导出为Excel文件
df.to_excel("dpl_data.xlsx", index=False, engine="openpyxl")

# 统计记录条数
print(f"总记录条数:{len(df)}")

代码说明

  • 先对返回的文本按换行符拆分,过滤无意义的空行
  • 该数据集以|作为字段分隔符,拆分后对齐表头生成结构化数据
  • 导出Excel时设置index=False避免导出多余的行号列
  • 记录条数直接取DataFrame的长度即可,自动排除了表头行

内容的提问来源于stack exchange,提问作者Raja Manikam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 08:36:03