You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark/Spark DataFrame中为日期列加整数天数并新增行?

解决方案

步骤说明

要实现需求,核心思路是复制原DataFrame并计算新的next_apt时间戳,再将新数据与原数据合并。以下是具体实现代码:

代码实现

首先确保你的时间戳列和天数列是正确的数据类型(如果尚未转换):

import pandas as pd

# 假设你的原始DataFrame名为df
# 转换next_apt为datetime类型,days为数值类型
df['next_apt'] = pd.to_datetime(df['next_apt'])
df['days'] = pd.to_numeric(df['days'])

然后生成包含新时间戳的行:

# 复制原数据,计算新的next_apt(原时间戳加上days天)
new_rows = df.copy()
new_rows['next_apt'] = new_rows['next_apt'] + pd.to_timedelta(new_rows['days'], unit='D')

最后合并原数据与新行,得到最终结果:

# 合并两个DataFrame并重置索引
final_df = pd.concat([df, new_rows], ignore_index=True)

可选:让原行与对应新行相邻排列

如果希望原数据的每一行后面紧跟其对应的新行,可以通过分组排序实现:

# 给原数据和新数据添加分组标识
df['group_id'] = df.index
new_rows['group_id'] = new_rows.index

# 合并后按group_id排序,再删除分组列
final_df = pd.concat([df, new_rows]) \
            .sort_values(by='group_id') \
            .drop(columns='group_id') \
            .reset_index(drop=True)

关键说明

  • pd.to_timedelta():将days列的数值转换为时间间隔,才能与datetime类型的next_apt进行加法运算。
  • pd.concat():用于合并原DataFrame和新生成的DataFrame,ignore_index=True会重新生成连续的索引。

内容的提问来源于stack exchange,提问作者asd

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.01 22:35:14