You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何解决Pandas合并多份Excel文件时的数据重复与行异常问题

问题描述

有三个Excel文件,数据分别对应3_AM Data、9_AM Data、3_PM Data,期望将三个文件的数据合并成一个工作表,要求行数保持不变、结构符合预期。但使用以下代码合并后出现数据重复,且数据框异常分组:

import pandas as pd

# Function to combine three Excel files
def combine_excel_files(file1, file2, file3, output_file):
    # Read the three Excel files
    df1 = pd.read_excel(file1)
    df2 = pd.read_excel(file2)
    df3 = pd.read_excel(file3)
    
    # Merge data frames based on a common column (adjust the column name as per your data)
    merged_df = pd.merge(df1, df2, on=['Device', 'IP'], how='right')
    merged_df = pd.merge(merged_df, df3, on=['Device', 'IP'], how='right')
    # Write the combined data frame to a new Excel file
    merged_df.to_excel(output_file, index=False)
问题根源

你用了pd.merge做合并,这个方法是按指定列做横向关联匹配(类似数据库的JOIN操作),当Device和IP存在重复值时,会生成笛卡尔积导致数据重复;而你的需求是把三个同结构的时段数据纵向拼接(行堆叠),所以用错了方法。

修复方案

改用pd.concat实现纵向拼接,同时可以添加时段标识方便区分不同来源的数据:

修改后的代码

import pandas as pd

def combine_excel_files(file1, file2, file3, output_file):
    # 读取三个Excel文件
    df1 = pd.read_excel(file1)
    df2 = pd.read_excel(file2)
    df3 = pd.read_excel(file3)
    
    # 给每个数据框添加时段标识列(可选但推荐)
    df1['Time'] = '3_AM'
    df2['Time'] = '9_AM'
    df3['Time'] = '3_PM'
    
    # 纵向拼接三个数据框
    merged_df = pd.concat([df1, df2, df3], ignore_index=True)
    
    # 输出到新Excel文件
    merged_df.to_excel(output_file, index=False)

关键说明

  • pd.concat([df1, df2, df3], ignore_index=True):把三个数据框的行依次堆叠,ignore_index=True会重置合并后的数据框索引,避免索引重复。
  • 时段标识列:添加Time列可以明确区分每一行数据属于哪个时段,后续分析更方便,如果不需要可以删除这几行代码。
  • 处理列名不一致:如果三个Excel文件的列名有差异,可以添加join='inner'参数只保留共同列(pd.concat([df1, df2, df3], ignore_index=True, join='inner')),或者用join='outer'保留所有列(默认行为)。

内容的提问来源于stack exchange,提问作者Anuj Kalra

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 01:49:59