如何加速Jupyter中66万行DataFrame列的datetime类型转换?
66万行数据集时间列转datetime的提速方案
排查并清理脏数据:如果
local_time列存在不符合%d/%m/%Y格式的数据,pd.to_datetime会自动从高效的批量解析切换为逐行解析,速度会暴跌。先快速定位异常行:bad_entries = df[~df['local_time'].str.fullmatch(r'\d{2}/\d{2}/\d{4}')] print(bad_entries)清理或统一格式后,再用指定
format的pd.to_datetime,批量解析的速度远快于自动推断。强制批量解析跳过脏数据:如果不想清理脏数据,可通过
errors='coerce'参数让pd.to_datetime保持批量解析模式,将不符合格式的内容转为NaT:df['local_time'] = pd.to_datetime(df['local_time'], format='%d/%m/%Y', errors='coerce')分块处理缓解内存碎片化:把数据集拆分成小块分别处理,避免内存碎片化带来的性能损耗:
import numpy as np chunks = np.array_split(df, 10) # 可根据内存情况调整分块数量 df['local_time'] = pd.concat([pd.to_datetime(chunk['local_time'], format='%d/%m/%Y') for chunk in chunks])用PyArrow引擎加速解析:如果你的Pandas版本≥2.0,安装
pyarrow后,指定engine='pyarrow'可大幅提升解析速度:df['local_time'] = pd.to_datetime(df['local_time'], format='%d/%m/%Y', engine='pyarrow')降低内存占用:用
df.info(memory_usage='deep')检查内存消耗,暂时删除不需要的列,减少内存压力,避免因内存不足导致的速度下降。避免Jupyter实时渲染干扰:如果Notebook的实时输出拖慢速度,可将代码写成
.py脚本直接运行,或在Notebook中关闭不必要的中间输出。
内容的提问来源于stack exchange,提问作者Laurynas G
相关产品推荐
相关产品推荐

