Pandas.read_csv读取CSV表头与索引列错位问题解决
解决Teensy ADC导出CSV文件的Pandas读取错位问题
问题背景
从Teensy ADC导出到SD卡的CSV文件,使用Pandas.read_csv读取时出现表头与数据列错位:表头列数比数据多一列,导致出现整列NaN。尝试调整header、index_col等参数无效,手动删除所有CSV文件首列效率极低。需求是将SampleNumber列设为索引(因部分文件编号不一致),或直接移除该列。
问题原因
原始CSV文件前两行是无关注释行(Start of new file:和MISCOUNT: 0),之前的读取参数错误地跳过了第一行并将第二行作为表头,导致表头与实际数据列不匹配,引发错位。
解决方案
方案1:将SampleNumber设为索引(推荐)
修改读取代码,跳过前两行注释,指定正确的表头行,并将SampleNumber列设为索引:
import numpy as np import matplotlib.pyplot as plt import pandas as pd from scipy import stats filename = "data.csv" # 跳过前两行注释,使用第3行作为表头,同时将SampleNumber设为索引 data = pd.read_csv(filename, skiprows=2, index_col="SampleNumber") print(data.head())
方案2:直接移除SampleNumber列
如果不需要将SampleNumber作为索引,可读取后直接删除该列:
import numpy as np import matplotlib.pyplot as plt import pandas as pd from scipy import stats filename = "data.csv" # 跳过前两行注释,读取完整数据 data = pd.read_csv(filename, skiprows=2) # 移除SampleNumber列 data = data.drop(columns="SampleNumber") print(data.head())
验证结果
使用方案1读取后,输出将与期望格式一致:
C0 C1 C2 C3 C4 C5 C6 C7 C8 C9 C10 C11 C12 C13 C14 C15 SampleNumber 0 3472 3030 2813 2695 2649 2636 2634 2632 2635 2635 2626 2624 2625 2623 2633 2597 1 2582 2581 2576 2561 2538 2511 2498 2490 2487 2484 2481 2481 2475 2475 2469 2475 2 2472 2474 2472 2474 2474 2474 2478 2474 2476 2484 2485 2490 2484 2485 2478 2486 3 2485 2483 2488 2488 2485 2486 2485 2484 2485 2483 2485 2483 2485 2483 2490 2473 4 2475 2472 2474 2477 2479 2482 2482 2482 2483 2487 2483 2482 2484 2483 2477 2483
内容的提问来源于stack exchange,提问作者N Mastick
相关产品推荐
相关产品推荐

