You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Dataflow Pipeline Gen2中匿名化Azure SQL同步至Lakehouse的数据

在Dataflow Pipeline Gen2中实现Azure SQL到Lakehouse的数据匿名化

一、先搭好基础同步管道

  • 新建Dataflow Gen2管道,添加Azure SQL数据源,填好生产库的连接信息,选好要同步的目标表。
  • 接着添加Lakehouse目标,指定要写入的表路径,表可以提前建好,也可以让管道自动生成。

二、核心:插入匿名化转换

在数据源和目标节点之间,插入派生列转换,针对邮箱、用户名分别做处理:

1. 邮箱字段的两种匿名化方案

哈希加密(保留域名可选)

如果要保留域名,只加密前缀,用这个表达式:

concat(sha2(trim(email), 256), '@', split(trim(email), '@')[1])

要是完全匿名,直接用:

sha2(trim(email), 256)

部分字符替换(更易识别格式)

隐藏前缀中间字符,保留首尾和域名,比如把user@example.com变成us****@example.com,表达式:

concat(left(trim(email), 2), repeat('*', length(split(trim(email), '@')[0])-2), '@', split(trim(email), '@')[1])

2. 用户名字段的匿名化

全值哈希

直接对用户名做SHA-256哈希:

sha2(trim(username), 256)

部分字符替换

保留用户名首尾字符,中间用*填充,比如john_doe变成j****e,表达式:

if(length(trim(username)) <= 2, trim(username), concat(left(trim(username), 1), repeat('*', length(trim(username))-2), right(trim(username), 1)))

3. 替换原字段(可选)

如果不想新增字段,直接覆盖原始值,就在派生列里把新表达式的字段名设成原字段名(比如email),这样同步时就会用匿名化后的值替换原始数据。

三、验证运行

  • 点数据预览看看匿名化后的效果是否符合要求。
  • 配置好管道的运行触发方式(按需跑或者定时同步),启动任务后,数据就会自动匿名化后写入Lakehouse。

内容的提问来源于stack exchange,提问作者frosty

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.15 15:12:12