PySpark处理二进制文件时的指数级运行时行为问题求助
PySpark处理二进制文件时的指数级运行时行为问题求助
各位好,我最近在处理二进制文件时碰到了严重的性能瓶颈,实在没辙了想请教下大家。我的需求其实挺明确的:
- 把二进制文件分割成8字节的块,每个块的前4字节是后续要解码的数据,后4字节是毫秒级的时间偏移整数
- 移除这些8字节块里的重复项
- 如果文件末尾剩下不足8字节的内容,要做标记
但现在的运行时间完全超出预期,简直是指数级增长:200KB的文件要跑39秒,1.2MB的要2分02秒,到6MB的时候居然需要49分钟!这样下去根本没法处理更大的文件,我的实现方式肯定哪里出问题了。
下面是我目前用的代码:
def process(se... # 原代码未完整粘贴
备注:内容来源于stack exchange,提问作者dermoritz
相关产品推荐
相关产品推荐

