pd.concat合并DataFrame报InvalidIndexError错误是什么原因?
报错原因
该报错的核心触发条件是参与合并的DataFrame存在包含重复值的Index对象(包括行索引、列索引两类)。你给出的示例代码在标准pandas环境下可正常运行,说明你实际使用的df1或df2存在以下两类隐藏问题:
- 你误判了行索引的唯一性,实际至少一个DataFrame的行索引存在重复值,可执行以下代码验证:
# 分别检查两个DataFrame的行索引是否存在重复 print(df1.index.has_duplicates) print(df2.index.has_duplicates)
- 你忽略了列索引的重复问题,至少一个DataFrame的列名存在重复值,可执行以下代码验证:
# 分别检查两个DataFrame的列索引是否存在重复 print(df1.columns.has_duplicates) print(df2.columns.has_duplicates)
修复方案
- 如果是行索引重复导致的报错,且不需要保留原有行索引,合并时添加
ignore_index=True参数即可:
df = pd.concat([df1, df2], ignore_index=True)
如果需要保留原有行索引,先对存在重复行索引的DataFrame做索引去重、重命名处理后再执行合并。
- 如果是列索引重复导致的报错,先对重复列名进行重命名,保证每个DataFrame的列名唯一后再合并即可。
内容的提问来源于stack exchange,提问作者MichKats
相关产品推荐
相关产品推荐

