You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在MongoDB中执行聚合查询后删除重复文档

删除重复文档的实现方案

你原来的聚合语句仅能查询到存在重复的url值列表,想要删除重复文档需要先确定每个url分组下需要保留的文档,再删除其余重复项,以下是两种常用实现方案:

方案1:小批量数据场景,保留指定文档后删除其余重复项

该方案适合数据量不大的场景,默认保留每个url分组下最早插入的1条文档,删除其余重复文档,你也可以按需调整保留规则:

  1. 先查询得到所有需要删除的文档_id列表:
const deleteIdList = db.Articles.aggregate([
  // 按url分组,收集同组所有文档的_id
  {
    "$group": {
      "_id": "$url",
      "allIds": { "$push": "$_id" },
      "count": { "$sum": 1 }
    }
  },
  // 过滤出存在重复、且url不为空的分组
  {
    "$match": {
      "_id": { "$ne": null },
      "count": { "$gt": 1 }
    }
  },
  // 移除分组中要保留的_id,剩下的就是需要删除的id
  {
    "$project": {
      // 此处$slice从第1位开始取,舍弃第0位(最早插入的文档id),若要保留最新的则改为取0到count-2位即可
      "ids": { "$slice": ["$allIds", 1, { "$subtract": ["$count", 1] }] },
      "_id": 0
    }
  },
  // 将id数组展开为一维结构
  { "$unwind": "$ids" },
  { "$replaceRoot": { "newRoot": "$ids" } }
]).toArray();
  1. 执行批量删除操作:
db.Articles.deleteMany({ "_id": { "$in": deleteIdList } });

方案2:大数据量场景,去重后直接生成新集合

如果数据量很大,批量删除效率较低,可以直接将去重后的结果写入新集合,替换原有集合即可:

// 每个url仅保留1条文档,写入新集合Articles_unique
db.Articles.aggregate([
  {
    "$group": {
      "_id": "$url",
      // 保留分组中第一条文档的全部内容,要保留最新的就把$first改为$last
      "doc": { "$first": "$$ROOT" }
    }
  },
  // 恢复为原文档的结构
  { "$replaceRoot": { "newRoot": "$doc" } },
  // 输出到新集合
  { "$out": "Articles_unique" }
]);

// 确认新集合数据无误后,执行替换操作
db.Articles.drop();
db.Articles_unique.renameCollection("Articles");

注意事项

  • 操作前务必先对数据做备份,或者先执行find命令确认要删除的文档符合预期,避免误删
  • 如果你的业务场景中允许url为空,可以自行调整match阶段的过滤规则

内容的提问来源于stack exchange,提问作者MaxxABillion

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 23:15:01