Azure文本分析脱敏PII遇问题:Aadhaar/CPF未识别且找不到piiCategories参数
解决Azure文本分析脱敏区域特定PII(Aadhaar/CPF)的问题
问题本质
你遇到的问题源于piiCategories参数仅在Azure文本分析Analyze PII API的v3.1+版本中可用,且默认配置不会自动触发区域特定PII的识别逻辑。
具体解决方案
- 升级API版本:必须使用API v3.1或更高版本,v3.0及以下版本无此参数。
- 显式指定PII类别:调用Analyze PII API时,在请求参数中声明
piiCategories数组,同时注意匹配文本语言:- 识别印度Aadhaar:语言设为
hi或en,参数添加"Aadhaar" - 识别巴西CPF:语言设为
pt-br,参数添加"CPF"
示例请求体:
{ "documents": [{"id": "1", "language": "en", "text": "用户Aadhaar号:1234-5678-9012"}], "parameters": { "piiCategories": ["Aadhaar"], "domain": "none" } } - 识别印度Aadhaar:语言设为
- 确认服务层级:确保你的文本分析资源是标准层(S),免费层会限制部分区域PII的识别能力。
- SDK版本适配:如果使用官方SDK(如Python的
azure-ai-textanalytics),需升级到v5.3及以上版本,旧版本SDK未封装piiCategories参数。
避坑提示
- 不要用错API:
piiCategories仅属于Analyze PII接口,Analyze Entities接口不支持该参数; - 避免错误识别:部分区域PII(如CPF)格式和手机号类似,显式指定类别可避免被误判。
内容的提问来源于stack exchange,提问作者Vinayak Dhar Dwivedi
相关产品推荐
相关产品推荐

