You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求助:将TMDB演员数据处理为规范Pandas DataFrame

解决方法
  • 先确认nameperson、knownfor、popularity字段都是列表类型,可以用以下代码检查:
    # 查看字段类型
    print(df[['nameperson', 'knownfor', 'popularity']].dtypes)
    # 查看每个字段的元素类型
    print(df['nameperson'].apply(type).unique())
    
  • 同时对这三个关联字段执行explode操作,保证演员的姓名、参演作品、热度和电影ID一一对应:
    df_exploded = df.explode(['nameperson', 'knownfor', 'popularity'], ignore_index=True)
    
  • 如果仍存在重复的电影-演员组合,执行去重操作:
    df_final = df_exploded.drop_duplicates(subset=['id', 'nameperson'], keep='first')
    

处理完成后,就能得到每行对应单个演员、结构为[id, nameperson, knownfor, popularity]的DataFrame,不会出现错乱的重复行。

内容的提问来源于stack exchange,提问作者rufina_mar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 08:25:21