如何合并数据集重复ID对应行并对其余变量计算平均值?
重复单词行合并(按均值聚合指标)实现方案
推荐用Python的pandas库实现,无需手动指定重复单词、无需逐个列设置规则,可自动完成全量数值指标的均值聚合,适配你数千行、60余项数值指标的数据集规模。
- 第一步:安装依赖(已安装可跳过)
执行命令:pip install pandas openpyxl
(openpyxl用于支持Excel格式文件读写,如果你用的是csv/tsv格式可以不装) - 第二步:执行处理代码
import pandas as pd # 1. 读入你的数据集,根据文件格式调整读取方法 # 如果是tsv/ csv格式 df = pd.read_csv("你的数据集文件路径", sep="\t") # csv格式把sep改成","即可 # 如果是xlsx格式用下面这行 # df = pd.read_excel("你的数据集文件路径.xlsx") # 2. 按单词列分组,对所有数值列自动计算均值 merged_df = df.groupby("Word", as_index=False).mean(numeric_only=True) # 3. 导出处理后的结果 merged_df.to_csv("合并去重后的结果.tsv", sep="\t", index=False) # 要导出Excel用下面这行 # merged_df.to_excel("合并去重后的结果.xlsx", index=False)
- 效果验证
你给出的示例数据运行上述代码后,输出结果和你预期的目标输出完全一致:自动识别aids、coke两个重复单词,对measure1-3三个指标分别计算均值,无额外手动操作。
内容的提问来源于stack exchange,提问作者user13343754
相关产品推荐
相关产品推荐

