You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何加速Jupyter中66万行DataFrame列的datetime类型转换?

66万行数据集时间列转datetime的提速方案
  • 排查并清理脏数据:如果local_time列存在不符合%d/%m/%Y格式的数据,pd.to_datetime会自动从高效的批量解析切换为逐行解析,速度会暴跌。先快速定位异常行:

    bad_entries = df[~df['local_time'].str.fullmatch(r'\d{2}/\d{2}/\d{4}')]
    print(bad_entries)
    

    清理或统一格式后,再用指定format的pd.to_datetime,批量解析的速度远快于自动推断。

  • 强制批量解析跳过脏数据:如果不想清理脏数据,可通过errors='coerce'参数让pd.to_datetime保持批量解析模式,将不符合格式的内容转为NaT:

    df['local_time'] = pd.to_datetime(df['local_time'], format='%d/%m/%Y', errors='coerce')
    
  • 分块处理缓解内存碎片化:把数据集拆分成小块分别处理,避免内存碎片化带来的性能损耗:

    import numpy as np
    chunks = np.array_split(df, 10)  # 可根据内存情况调整分块数量
    df['local_time'] = pd.concat([pd.to_datetime(chunk['local_time'], format='%d/%m/%Y') for chunk in chunks])
    
  • 用PyArrow引擎加速解析:如果你的Pandas版本≥2.0,安装pyarrow后,指定engine='pyarrow'可大幅提升解析速度:

    df['local_time'] = pd.to_datetime(df['local_time'], format='%d/%m/%Y', engine='pyarrow')
    
  • 降低内存占用:用df.info(memory_usage='deep')检查内存消耗,暂时删除不需要的列,减少内存压力,避免因内存不足导致的速度下降。

  • 避免Jupyter实时渲染干扰:如果Notebook的实时输出拖慢速度,可将代码写成.py脚本直接运行,或在Notebook中关闭不必要的中间输出。

内容的提问来源于stack exchange,提问作者Laurynas G

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 17:15:46