如何优雅高效计算list of DataFrames的均值?
计算DataFrame列表均值的优雅高效实现方法
针对你的需求,这里提供几种比手动循环更优雅且高效的实现方式,适配DataFrame场景:
1. 简洁首选:concat + mean
如果所有DataFrame结构一致(列名、索引匹配),直接用pandas的concat合并后求均值是最简洁的写法,而且pandas底层的优化会比手动循环更快:
import pandas as pd def mean_of_dfs(list_of_df): return pd.concat(list_of_df).mean()
这个方法一行核心代码就能完成,返回的结果是每个列的均值(和DataFrame结构对应);如果需要所有元素的全局均值,再加一步.mean()即可:pd.concat(list_of_df).mean().mean()
2. 内存友好:生成器累加
如果DataFrame数据量很大,合并会占用过多内存,可以用生成器表达式分别累加总和与元素数量,避免一次性加载所有数据:
import pandas as pd def mean_of_dfs_memory_safe(list_of_df): total_sum = sum(df.sum() for df in list_of_df) total_count = sum(df.size for df in list_of_df) return total_sum / total_count
这里df.sum()返回每个列的总和,df.size是DataFrame的总元素数;如果需要按列计算均值(基于所有DataFrame的该列行数),把total_count改成sum(df.shape[0] for df in list_of_df)即可。
3. 兼容原逻辑的优化版
如果你想保留类似原函数的循环逻辑,但适配DataFrame并更规范:
import pandas as pd def mean_of_dfs_loop_optimized(list_of_df): total_sum = None total_count = 0 for df in list_of_df: df_sum = df.sum() if total_sum is None: total_sum = df_sum else: total_sum += df_sum total_count += df.size return total_sum / total_count
这个方法避免了原函数中初始sum=0(标量)和DataFrame求和(Series)相加的潜在错误,同时保持了内存高效的特点。
方法对比
- 小数据量、结构一致:优先选
concat + mean,代码最简洁易读 - 大数据量、内存紧张:选生成器累加或优化后的循环,避免内存溢出
- 原函数的局限:仅适配Series,上述方法都解决了适配DataFrame的问题
内容的提问来源于stack exchange,提问作者Itrytobehelpful
相关产品推荐
相关产品推荐

