You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

合并结构相同表头不一致的pandas DataFrame用于KNN模型训练

Pandas同结构不同表头DataFrame合并解决方案

合并失败的核心原因是两个DataFrame列名不匹配:

  • 带表头读取的data列名为训练数据集自带的label、pixel0~pixel783
  • 用header=None读取的data_custom列名默认为整数序列0~784
    pd.concat会默认按列名对齐合并,列名不匹配就会生成大量空值,导致结果不符合预期。

方案1:读取自定义数据集时直接指定表头

读custom-data.csv时直接复用data的列名,从源头保证列名一致:

import pandas as pd

# 读取带表头的训练集
data = pd.read_csv('/content/drive/My Drive/Colab Notebooks/digit-recognition/train_data.csv')
# 读取自定义数据集时指定列名和训练集一致
data_custom = pd.read_csv('/content/drive/My Drive/Colab Notebooks/digit-recognition/custom-data.csv', header=None, names=data.columns)

# 合并并重置行索引
final_data = pd.concat([data, data_custom], ignore_index=True)

方案2:修改已读取的自定义数据集列名

如果已经完成两个数据集的读取,直接给data_custom重命名列名即可:

# 统一两个DataFrame的列名
data_custom.columns = data.columns
# 合并并重置行索引
final_data = pd.concat([data, data_custom], ignore_index=True)

合并结果验证

可以通过两行代码快速校验合并是否正确:

# 验证总行数是否匹配
print(len(final_data) == len(data) + len(data_custom))
# 验证是否存在空值,正常输出为0
print(final_data.isna().sum().sum())

内容的提问来源于stack exchange,提问作者sunny

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 21:54:04