如何在Google Data Studio中将计数<25的类别重分类为REDACTED?
在Google Data Studio实现人口统计特征的低数量脱敏重分类
问题背景
要制作人口统计仪表板,要求当某类人口统计特征的个体数量少于25时,将该特征重分类为REDACTED;且不能提前聚合数据源,必须在Google Data Studio内基于个体粒度数据完成处理。原伪代码因混合聚合与非聚合逻辑无法正常运行。
解决方案
1. 创建脱敏计算字段
在数据源中新建一个计算字段(例如命名为脱敏性别),使用窗口函数实现分组计数判断:
CASE WHEN COUNT(gender) OVER (PARTITION BY gender) < 25 THEN "REDACTED" ELSE gender END
- 核心逻辑:
COUNT(gender) OVER (PARTITION BY gender)会为每一行数据返回其所属性别分组的总个体数,全程不改变原数据的个体粒度;当分组个体数小于25时,自动替换为REDACTED,否则保留原特征值。
2. 配置可视化报表
使用新创建的脱敏性别作为维度,搭配记录数作为指标,即可得到符合要求的输出:
| 脱敏性别 | 记录数 |
|---|---|
| female | 222 |
| male | 223 |
| REDACTED | 55 |
方案优势
窗口函数OVER (PARTITION BY)完美解决了原伪代码的逻辑冲突——它能在不聚合数据行的前提下,计算每个分组的聚合值,全程在Google Data Studio内完成处理,无需修改原始数据源的粒度。
内容的提问来源于stack exchange,提问作者Brad
相关产品推荐
相关产品推荐

