如何将TXT文件读取为DataFrame并单独保存变量信息?
处理方案
1. 提取并保存变量信息
该TXT文件开头的注释行包含变量说明,可先将这部分内容提取出来单独保存:
# 读取原文件内容 with open('suites_dw_Table1.txt', 'r', encoding='utf-8') as f: all_lines = f.readlines() # 筛选出所有以#开头的变量说明行 var_description = [line for line in all_lines if line.startswith('#')] # 将变量信息写入新文件 with open('变量说明文档.txt', 'w', encoding='utf-8') as f: f.writelines(var_description)
2. 将表格数据加载为DataFrame
使用pandas库读取表格部分,跳过注释行并处理空格分隔的格式:
import pandas as pd # 读取表格数据,跳过#开头的注释行,用任意空白字符作为分隔符 df = pd.read_table( 'suites_dw_Table1.txt', sep='\s+', # 适配多空格/制表符分隔的格式 comment='#', # 忽略所有#开头的行 encoding='utf-8' ) # 验证加载结果 print(df.head())
补充说明
- 如果表头行前还有非注释的空行或其他无关行,可以添加
skiprows参数指定跳过的行数(比如skiprows=5表示跳过前5行) - 若数据存在缺失值,可添加
na_values参数定义缺失值标识(比如na_values=['-', 'NaN'])
内容的提问来源于stack exchange,提问作者sam
相关产品推荐
相关产品推荐

