百万级Word模型对象列表按word属性快速去重方法
总结
- 优先选哈希字典法:速度最快、实现简单,内存开销取决于唯一
word的数量(重复率越高越省内存); - 需要定制保留规则时,在字典法基础上添加判断逻辑即可;
- 只有当列表已按
word排序时,再考虑用groupby,否则排序的时间成本太高。
内容的提问来源于stack exchange,提问作者Arash Hatami
相关产品推荐
相关产品推荐
word的数量(重复率越高越省内存);word排序时,再考虑用groupby,否则排序的时间成本太高。内容的提问来源于stack exchange,提问作者Arash Hatami