如何在MongoDB中执行聚合查询后删除重复文档
删除重复文档的实现方案
你原来的聚合语句仅能查询到存在重复的url值列表,想要删除重复文档需要先确定每个url分组下需要保留的文档,再删除其余重复项,以下是两种常用实现方案:
方案1:小批量数据场景,保留指定文档后删除其余重复项
该方案适合数据量不大的场景,默认保留每个url分组下最早插入的1条文档,删除其余重复文档,你也可以按需调整保留规则:
- 先查询得到所有需要删除的文档
_id列表:
const deleteIdList = db.Articles.aggregate([ // 按url分组,收集同组所有文档的_id { "$group": { "_id": "$url", "allIds": { "$push": "$_id" }, "count": { "$sum": 1 } } }, // 过滤出存在重复、且url不为空的分组 { "$match": { "_id": { "$ne": null }, "count": { "$gt": 1 } } }, // 移除分组中要保留的_id,剩下的就是需要删除的id { "$project": { // 此处$slice从第1位开始取,舍弃第0位(最早插入的文档id),若要保留最新的则改为取0到count-2位即可 "ids": { "$slice": ["$allIds", 1, { "$subtract": ["$count", 1] }] }, "_id": 0 } }, // 将id数组展开为一维结构 { "$unwind": "$ids" }, { "$replaceRoot": { "newRoot": "$ids" } } ]).toArray();
- 执行批量删除操作:
db.Articles.deleteMany({ "_id": { "$in": deleteIdList } });
方案2:大数据量场景,去重后直接生成新集合
如果数据量很大,批量删除效率较低,可以直接将去重后的结果写入新集合,替换原有集合即可:
// 每个url仅保留1条文档,写入新集合Articles_unique db.Articles.aggregate([ { "$group": { "_id": "$url", // 保留分组中第一条文档的全部内容,要保留最新的就把$first改为$last "doc": { "$first": "$$ROOT" } } }, // 恢复为原文档的结构 { "$replaceRoot": { "newRoot": "$doc" } }, // 输出到新集合 { "$out": "Articles_unique" } ]); // 确认新集合数据无误后,执行替换操作 db.Articles.drop(); db.Articles_unique.renameCollection("Articles");
注意事项
- 操作前务必先对数据做备份,或者先执行find命令确认要删除的文档符合预期,避免误删
- 如果你的业务场景中允许url为空,可以自行调整match阶段的过滤规则
内容的提问来源于stack exchange,提问作者MaxxABillion
相关产品推荐
相关产品推荐

