无明确分隔符的TXT文件如何读取并转换为Pandas数据框
调整方案
你的文件属于带前置元数据的制表符分隔文本,之前读取失败的核心原因是未跳过无效前置行、用空格作为分隔符导致列拆分错误,可按以下代码调整:
import pandas as pd # 手动指定列名,跳过前置无效行和原有表头行 summary = pd.read_csv( r"C:\Users\eduardo.romero\Documents\VSC_TXT\Summary.txt", skiprows=8, # 可根据你实际文件的表头位置调整数值:数清楚从第一行到表头行上方共有多少行就填多少 sep="\t", skip_blank_lines=True, names=["Position", "Serial", "Fail reason"] ) # 可选:数据清洗优化 # 去掉Position列的冒号,转为数字格式 summary["Position"] = summary["Position"].str.strip(":").str.strip().astype(int) # 把未报错的行的失败原因填充为PASS(也可根据需求填空字符串) summary["Fail reason"] = summary["Fail reason"].fillna("PASS").str.strip() # 清理Serial列的前后空白 summary["Serial"] = summary["Serial"].str.strip()
如果调整skiprows后还是读取错位,可以先打开原始TXT文件,数清楚「Position Serial Fail reason」这一行是第几行(从0开始计数),skiprows就填这个行号+1即可,直接跳过原有表头自己指定列名可以避免Fail reason因为带空格被拆成两列的问题。
内容的提问来源于stack exchange,提问作者Eduardo Romero
相关产品推荐
相关产品推荐

