如何将指定格式txt文件读取解析为pandas DataFrame
实现步骤
你的文件每行结构为时间戳 + 空格 + JSON格式用户属性,行间存在空行,按以下流程处理即可得到目标DataFrame:
- 逐行读取txt文件,过滤掉无内容的空行,避免解析报错
- 按每行第一个空格做分割,前半段为timestamp字段值,后半段为JSON格式的用户信息
- 用标准库json解析后半段的JSON字符串为字典,把拆分得到的时间戳写入字典
- 把所有处理完成的字典传入pandas.DataFrame,按要求指定列顺序即可
完整可运行代码
import pandas as pd import json record_list = [] # 把括号里的路径替换成你本地txt文件的实际路径 with open("your_data.txt", "r", encoding="utf-8") as f: for raw_line in f: line = raw_line.strip() # 跳过空行 if not line: continue # 按第一个空格拆分时间戳和JSON内容 ts, json_content = line.split(maxsplit=1) # 解析JSON为字典 user_data = json.loads(json_content) user_data["timestamp"] = ts record_list.append(user_data) # 生成DataFrame并指定列顺序 df = pd.DataFrame(record_list, columns=["timestamp", "name", "id", "password"])
输出效果
运行后打印df即可得到符合要求的结构化表格:
timestamp name id password 0 12:12 alice 1 123 1 12:14 bob 2 1fsdf3 2 12:18 claire 3 12fs3
注:如果后续时间戳格式带日期(比如
2024-01-01 12:12),上述拆分逻辑依然生效,不需要额外修改。
内容的提问来源于stack exchange,提问作者jds
相关产品推荐
相关产品推荐

