You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas扁平化JSON后保留time_published列的技术问询

解决方案

方法1:优化实现(无需手动索引循环)

假设你的原始DataFrame名为original_df,其中ticker_data是存储股票字典的列,time_published是新闻发布时间列。可以通过以下代码一次性完成扁平化并保留时间关联:

df_final = pd.concat(
    [pd.json_normalize(row['ticker_data']).assign(time_published=row['time_published'])
     for _, row in original_df.iterrows()],
    ignore_index=True
).dropna()

方法2:修改你原有循环代码

如果想保留自己的循环逻辑,只需在扁平化每行字典后,把对应行的time_published值追加到临时DataFrame中即可:

df_final = pd.DataFrame()
# 替换成你的原始DataFrame,确保包含time_published列和存储字典的列(示例中为ticker_data)
original_df = your_original_dataframe_here

for i in range(len(original_df)):
    df_flat_ticker_temp = pd.json_normalize(original_df['ticker_data'].iloc[i])
    # 关键步骤:为当前扁平化后的所有行绑定对应新闻的发布时间
    df_flat_ticker_temp['time_published'] = original_df['time_published'].iloc[i]
    df_final = pd.concat([df_final, df_flat_ticker_temp], ignore_index=True)

df_final = df_final.dropna()

核心逻辑

你之前的代码仅对字典数据做了扁平化处理,但未将原行的time_published与展开后的行建立关联。上述两种方法都是在处理每行字典时,将该行的新闻发布时间赋值给扁平化后的所有行,确保每个从字典拆分出的股票记录都能对应到所属新闻的发布时间。

内容的提问来源于stack exchange,提问作者phx88

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.30 13:13:36