关于l-diversity的偏斜攻击(Skewness Attack)的定义及相关技术疑问咨询
什么是l-diversity中的偏斜攻击(Skewness Attack)?
先快速铺垫下背景:l-diversity是为了弥补k-anonymity的缺陷而生的——k-anonymity只保证每个等价类(即属性特征完全相同的用户组)有至少k个用户,但如果组里所有人的敏感属性都一致(比如全是“癌症”患者),攻击者还是能直接锁定目标用户的敏感信息。所以l-diversity加了个要求:每个等价类里的敏感属性至少要有l个不同取值,以此来增加不确定性。
而偏斜攻击就是专门钻l-diversity设计漏洞的攻击方式:它利用敏感属性在全局数据集或者单个等价类内的分布偏斜(也就是某个取值占绝对主导比例),哪怕等价类满足了“有l个不同敏感值”的要求,攻击者依然能以极高概率推断出目标用户的敏感属性。
给你举个具体的例子就懂了:
假设我们的数据集是医院患者记录,敏感属性是“疾病类型”,全局分布里“流感”占90%,“癌症”仅占10%。现在有一个等价类满足2-diversity:里面有9个流感患者,1个癌症患者。
当攻击者知道目标用户属于这个等价类时,虽然类里确实有两种疾病,但结合全局的偏斜分布,他可以直接推断目标用户得流感的概率是90%——这和没做隐私保护的情况几乎没区别,l-diversity的保护效果直接失效了。
最后再提炼下偏斜攻击的核心:
- l-diversity只关注敏感属性的取值数量,完全忽略了取值的分布比例
- 当某个敏感值在等价类或全局中占比极高时,哪怕满足l-diversity的数量要求,攻击者依然能通过概率推断突破隐私保护
内容的提问来源于stack exchange,提问作者user238795
相关产品推荐
相关产品推荐

