求助:将TMDB演员数据处理为规范Pandas DataFrame
解决方法
- 先确认
nameperson、knownfor、popularity字段都是列表类型,可以用以下代码检查:# 查看字段类型 print(df[['nameperson', 'knownfor', 'popularity']].dtypes) # 查看每个字段的元素类型 print(df['nameperson'].apply(type).unique()) - 同时对这三个关联字段执行
explode操作,保证演员的姓名、参演作品、热度和电影ID一一对应:df_exploded = df.explode(['nameperson', 'knownfor', 'popularity'], ignore_index=True) - 如果仍存在重复的电影-演员组合,执行去重操作:
df_final = df_exploded.drop_duplicates(subset=['id', 'nameperson'], keep='first')
处理完成后,就能得到每行对应单个演员、结构为[id, nameperson, knownfor, popularity]的DataFrame,不会出现错乱的重复行。
内容的提问来源于stack exchange,提问作者rufina_mar
相关产品推荐
相关产品推荐

