Pandas追加列不完整的DataFrame到CSV时列对齐异常如何解决
问题原因
pandas.DataFrame.to_csv在追加模式(mode='a')下设置header=False时,不会匹配原CSV文件的列名,仅按当前待写入DataFrame的列顺序逐列写入值。你的原CSV包含col1、col2、col3三列,待追加的DataFrame仅含col2一列,因此写入时20会被填入原文件第一列(col1)的位置,后续列自动补NaN,与预期不符。
解决方法
方案1:自动对齐原文件列(推荐)
仅读取原CSV的表头做列对齐,无需加载全量数据,性能开销极低,适配原文件列顺序变更的场景:
import pandas as pd # 仅读取表头,不加载数据 original_cols = pd.read_csv(csi_filepath, nrows=0).columns # 构造待写入数据 df = pd.DataFrame({'col2': [20]}) # 按原文件列顺序重排,缺失列自动补空值 df = df.reindex(columns=original_cols) # 追加写入 df.to_csv(csi_filepath, mode='a', index=False, header=False)
方案2:手动构造全列DataFrame
如果明确原文件的列顺序和列名,可直接构造完全匹配的DataFrame:
import pandas as pd import numpy as np df = pd.DataFrame({ 'col1': [np.nan], 'col2': [20], 'col3': [np.nan] }, columns=['col1', 'col2', 'col3']) df.to_csv(csi_filepath, mode='a', index=False, header=False)
内容的提问来源于stack exchange,提问作者Eduardo Seity
相关产品推荐
相关产品推荐

