You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将TXT文件读取为DataFrame并单独保存变量信息?

处理方案

1. 提取并保存变量信息

该TXT文件开头的注释行包含变量说明,可先将这部分内容提取出来单独保存:

# 读取原文件内容
with open('suites_dw_Table1.txt', 'r', encoding='utf-8') as f:
    all_lines = f.readlines()

# 筛选出所有以#开头的变量说明行
var_description = [line for line in all_lines if line.startswith('#')]

# 将变量信息写入新文件
with open('变量说明文档.txt', 'w', encoding='utf-8') as f:
    f.writelines(var_description)

2. 将表格数据加载为DataFrame

使用pandas库读取表格部分,跳过注释行并处理空格分隔的格式:

import pandas as pd

# 读取表格数据,跳过#开头的注释行,用任意空白字符作为分隔符
df = pd.read_table(
    'suites_dw_Table1.txt',
    sep='\s+',  # 适配多空格/制表符分隔的格式
    comment='#',  # 忽略所有#开头的行
    encoding='utf-8'
)

# 验证加载结果
print(df.head())

补充说明

  • 如果表头行前还有非注释的空行或其他无关行,可以添加skiprows参数指定跳过的行数(比如skiprows=5表示跳过前5行)
  • 若数据存在缺失值,可添加na_values参数定义缺失值标识(比如na_values=['-', 'NaN'])

内容的提问来源于stack exchange,提问作者sam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.18 14:45:34