You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark处理二进制文件时的指数级运行时行为问题求助

PySpark处理二进制文件时的指数级运行时行为问题求助

各位好,我最近在处理二进制文件时碰到了严重的性能瓶颈,实在没辙了想请教下大家。我的需求其实挺明确的:

  • 把二进制文件分割成8字节的块,每个块的前4字节是后续要解码的数据,后4字节是毫秒级的时间偏移整数
  • 移除这些8字节块里的重复项
  • 如果文件末尾剩下不足8字节的内容,要做标记

但现在的运行时间完全超出预期,简直是指数级增长:200KB的文件要跑39秒,1.2MB的要2分02秒,到6MB的时候居然需要49分钟!这样下去根本没法处理更大的文件,我的实现方式肯定哪里出问题了。

下面是我目前用的代码:

def process(se...  # 原代码未完整粘贴

备注:内容来源于stack exchange,提问作者dermoritz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.13 16:39:30