You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何合并数据集重复ID对应行并对其余变量计算平均值?

重复单词行合并(按均值聚合指标)实现方案

推荐用Python的pandas库实现,无需手动指定重复单词、无需逐个列设置规则,可自动完成全量数值指标的均值聚合,适配你数千行、60余项数值指标的数据集规模。

  • 第一步:安装依赖(已安装可跳过)
    执行命令:
    pip install pandas openpyxl
    (openpyxl用于支持Excel格式文件读写,如果你用的是csv/tsv格式可以不装)
  • 第二步:执行处理代码
import pandas as pd

# 1. 读入你的数据集,根据文件格式调整读取方法
# 如果是tsv/ csv格式
df = pd.read_csv("你的数据集文件路径", sep="\t") # csv格式把sep改成","即可
# 如果是xlsx格式用下面这行
# df = pd.read_excel("你的数据集文件路径.xlsx")

# 2. 按单词列分组,对所有数值列自动计算均值
merged_df = df.groupby("Word", as_index=False).mean(numeric_only=True)

# 3. 导出处理后的结果
merged_df.to_csv("合并去重后的结果.tsv", sep="\t", index=False)
# 要导出Excel用下面这行
# merged_df.to_excel("合并去重后的结果.xlsx", index=False)
  • 效果验证
    你给出的示例数据运行上述代码后,输出结果和你预期的目标输出完全一致:自动识别aids、coke两个重复单词,对measure1-3三个指标分别计算均值,无额外手动操作。

内容的提问来源于stack exchange,提问作者user13343754

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 17:15:03