将大型Pandas DataFrame转换为特定结构字典的最快方法
高效实现DataFrame转作者-视频列表字典的方案
直接使用pandas内置的分组聚合操作,完全避免低效的Python循环,代码如下:
# 基础版本:保留所有视频(包括重复) result_dict = df.groupby('author')['video'].agg(list).to_dict()
如果需要对每个作者的视频列表去重,且希望保留视频首次出现的顺序,可以用:
# 去重并保持顺序版本 result_dict = df.groupby('author')['video'].agg(lambda x: list(dict.fromkeys(x))).to_dict()
为什么这个方法高效?
pandas的groupby是底层优化过的操作(基于C实现),能批量处理分组逻辑,相比手动循环逐个筛选作者的方式,性能提升几个数量级,完全适配你4000万行数据、400万唯一作者的场景。
内容的提问来源于stack exchange,提问作者norberto
相关产品推荐
相关产品推荐

