Pandas按用户分组计算相邻时间戳秒级间隔问题求助
现有代码的问题
- 未按用户ID分组计算差值,会误算不同用户相邻记录的时间差
- 时间差转秒的逻辑错误,无法得到整数秒的结果
- 循环逐行赋值的写法效率极低,不符合pandas的最优实践
正确实现代码
步骤1:转换时间戳格式(原有写法正确可保留)
import pandas as pd df['timestamp'] = pd.to_datetime(df['timestamp'], format = "%d-%m-%Y %H:%M:%S")
步骤2:按用户分组计算相邻时间间隔
df['duration(s)'] = df.groupby('ID')['timestamp'].diff().dt.total_seconds()
运行后得到的duration(s)列完全符合预期:每个用户首条记录为NaN,后续为和上一条同用户记录的间隔秒数。
内容的提问来源于stack exchange,提问作者Hermoine
相关产品推荐
相关产品推荐

