MongoDB聚合:按会话时长分桶时仅统计唯一用户
MongoDB聚合:分桶统计时按用户去重计数
你的需求是对会话时长按边界[0,30,50]分桶,但每个分桶内同一用户仅统计一次——哪怕该用户有多个会话落在同一分桶,或者跨多个分桶(比如John的会话同时覆盖<30和30-50区间,两个桶里都要算他一次,但每个桶只计一次)。之前先按name分组再分桶的思路会丢失跨桶数据,因为分组后只能保留用户的某一个时长(比如最大或最小),无法覆盖所有所属分桶。
解决方案:先收集用户全量会话区间,再拆分分桶标签统计
核心思路是先拿到每个用户的所有会话时长,判断他们属于哪些分桶,再对每个分桶单独统计唯一用户数。具体聚合管道如下:
db.sessions.aggregate([ // 步骤1:按用户分组,收集该用户所有会话时长 { $group: { _id: "$name", sessionDurations: { $push: "$sessionDuration" } } }, // 步骤2:为每个用户生成所属的分桶标签 { $addFields: { buckets: { $filter: { input: [ { label: "30", min: 0, max: 30 }, { label: "50", min: 30, max: 50 } ], cond: { $anyElementTrue: { $map: { input: "$sessionDurations", as: "dur", in: { $and: [{ $gte: ["$$dur", "$$this.min"] }, { $lt: ["$$dur", "$$this.max"] }] } } } } } } } }, // 步骤3:拆分每个用户的分桶标签为单独文档 { $unwind: "$buckets" }, // 步骤4:按分桶标签分组,统计唯一用户数 { $group: { _id: "$buckets.label", count: { $sum: 1 } } }, // 步骤5:将结果整理为预期的键值对格式 { $group: { _id: null, time: { $first: "Unique_Name_Users_Only_Lies_In_This_Boundary" }, "30": { $sum: { $cond: [{ $eq: ["$_id", "30"] }, "$count", 0] } }, "50": { $sum: { $cond: [{ $eq: ["$_id", "50"] }, "$count", 0] } } } }, // 移除冗余的_id字段 { $project: { _id: 0 } } ])
步骤解释:
- 步骤1:按
name分组,把每个用户的所有会话时长收集到数组里,确保不遗漏该用户的任何会话区间。 - 步骤2:定义分桶规则,用
$filter判断当前用户是否有会话落在某个分桶内,生成该用户所属的所有分桶标签。比如John的会话有29、25、45,会匹配到"30"和"50"两个分桶。 - 步骤3:用
$unwind拆分分桶数组,让每个用户在每个所属分桶里都形成一条独立文档。 - 步骤4:按分桶标签分组计数,得到每个分桶的唯一用户数。
- 步骤5:把分散的分桶统计结果合并成你需要的单文档格式。
预期输出:
{ "time": "Unique_Name_Users_Only_Lies_In_This_Boundary", "30": 1, "50": 2 }
内容的提问来源于stack exchange,提问作者Mohammad Farhan
相关产品推荐
相关产品推荐

