Pandas DataFrame操作性能异常:数据量翻倍耗时剧增百倍
Pandas 特定服务器上的性能异常问题
数据情况
- 处理的是仅含0和1值的Pandas DataFrame,列名为物种标识
- 示例数据规模:固定30列,行数分别为450,631(low样本)和948,084(high样本);实际场景中这类DataFrame数量多达数万个,性能至关重要
异常表现
- 执行
df.cumsum()时,low样本仅耗时约0.2秒,行数仅翻倍的high样本却耗时约150秒,性能衰减幅度远超数据量增长比例 - 其他Pandas操作如
DataFrame.copy()、DataFrame[list_of_indices]也出现类似的耗时异常
排查与解决
- 性能更弱的本地笔记本运行
high.cumsum()仅需约1.6秒 - 其他Intel Xeon服务器运行正常,仅目标特定服务器存在该问题;目前已通过更换服务器恢复正常性能
内容的提问来源于stack exchange,提问作者Robin Warner
相关产品推荐
相关产品推荐

