如何使用Python pandas对CSV中同值行计算各分数列的平均值
实现方案
基础版(仅输出平均值数值)
如果只需要平均值的数值结果,不需要括号内的计算过程说明,用以下代码即可:
import pandas as pd # 替换为你的CSV文件实际路径 df = pd.read_csv("your_data.csv") # 按term、unique_identity分组,对三个score列求平均值 res = df.groupby(["term", "unique_identity"], as_index=False)[["score1", "score2", "score3"]].mean() # 重命名列符合预期输出格式 res = res.rename(columns={ "unique_identity": "unique_id", "score1": "average_score1", "score2": "average_score2", "score3": "average_score3" }) # 输出结果,如需保存到CSV取消注释下一行 # res.to_csv("average_result.csv", index=False) print(res)
完整版(输出带计算过程的字符串格式)
如果需要和示例完全一致,包含括号内的求和计算说明,使用自定义聚合函数实现:
import pandas as pd df = pd.read_csv("your_data.csv") def calc_avg_with_note(series): val_list = series.tolist() avg = sum(val_list) / len(val_list) calc_note = "+".join(map(str, val_list)) + f"/{len(val_list)}" # 可根据需求调整小数点保留位数 return f"{avg:.4f}({calc_note})" res = df.groupby(["term", "unique_identity"], as_index=False).agg( score1 = ("score1", calc_avg_with_note), score2 = ("score2", calc_avg_with_note), score3 = ("score3", calc_avg_with_note) ) res = res.rename(columns={ "unique_identity": "unique_id", "score1": "average_score1", "score2": "average_score2", "score3": "average_score3" }) print(res)
常见出错原因
- 分组时未添加
as_index=False,导致分组键变成行索引,输出后看不到对应列 - 分组键遗漏
term字段,若存在多个不同term值时会出现统计错误 - 聚合时未指定具体要计算的score列,触发非数值列聚合报错
内容的提问来源于stack exchange,提问作者Rajsxx
相关产品推荐
相关产品推荐

