You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在MS Fabric中实现Delta Lake的Medallion架构?寻求技术指导

在Microsoft Fabric中基于Delta Lake实现Medallion架构的实操思路

在Microsoft Fabric的Lakehouse中,原生支持Delta Lake格式,Medallion(奖牌)架构的核心是通过Bronze、Silver、Gold三层结构实现数据从原始形态到业务可用模型的逐步净化与价值提升,以下是具体落地思路和操作步骤:

一、Bronze层:原始数据摄入层

Bronze层用于存储未经处理的原始数据,完整保留数据原始形态,便于后续回溯排查。在Fabric中可通过以下方式实现:

  • 直接上传CSV、JSON、Parquet等原始文件到Lakehouse的Files目录,Fabric会自动将其注册为Delta表;也可手动通过Spark SQL完成转换
  • 利用Fabric数据集成管道批量同步外部数据源(如关系型数据库、Blob存储)到Lakehouse
  • 实时场景下,通过Eventstream或Kafka连接器将流数据写入Delta表

示例Spark SQL代码:

-- 创建Bronze层Delta表,存储原始JSON日志数据
CREATE TABLE bronze_raw_logs
USING DELTA
LOCATION 'Files/bronze/raw_logs'
AS SELECT * FROM json.`Files/raw_data/logs/*.json`

二、Silver层:数据清洗与转换层

Silver层负责对Bronze层数据做去重、格式修正、字段映射、缺失值处理等清洗操作,输出结构化、可信度高的中间数据。
核心操作要点:

  • 用Spark SQL或PySpark编写清洗逻辑,基于Bronze层Delta表做转换
  • 借助Delta Lake的ACID特性实现增量更新,避免重复处理全量数据
  • 可嵌入数据质量校验规则(如检查必填字段非空、格式合规)

示例PySpark代码:

from pyspark.sql.functions import col, current_timestamp

# 读取Bronze层原始数据
bronze_df = spark.read.format("delta").load("Files/bronze/raw_logs")

# 清洗逻辑:去重、过滤无效记录、添加处理时间戳
silver_df = bronze_df \
    .dropDuplicates(["log_id"]) \
    .filter(col("user_id").isNotNull()) \
    .withColumn("processed_time", current_timestamp())

# 写入Silver层Delta表,支持自动合并Schema
silver_df.write \
    .format("delta") \
    .mode("merge") \
    .option("mergeSchema", "true") \
    .save("Files/silver/cleaned_logs")

三、Gold层:业务聚合与建模层

Gold层是面向业务场景的最终数据模型,比如用户行为指标、销售汇总宽表等,供BI报表、分析查询直接调用。
核心操作要点:

  • 基于Silver层数据做聚合、关联,构建维度模型或宽表
  • 按业务需求设置定时刷新(如小时级、日级),保证数据时效性
  • 可创建物化视图或优化Delta表结构,提升查询性能

示例Spark SQL代码:

-- 创建Gold层用户日活跃统计表
CREATE TABLE gold_daily_active_users
USING DELTA
LOCATION 'Files/gold/daily_active_users'
AS SELECT
    date(processed_time) AS active_date,
    user_id,
    COUNT(DISTINCT session_id) AS session_count
FROM silver_cleaned_logs
GROUP BY date(processed_time), user_id

额外实践建议

  • Delta特性活用:充分使用Delta的版本控制、时间旅行(TIMESTAMP AS OF)、表优化(OPTIMIZE)等功能,维护数据湖的可追溯性和查询性能
  • Fabric工具联动:用Fabric Data Factory编排三层数据处理流程,设置定时调度;直接用Power BI连接Gold层表完成可视化分析
  • 权限管控:通过Fabric工作区权限设置,限制不同层级数据的访问范围(如仅业务分析师可访问Gold层)

内容的提问来源于stack exchange,提问作者willy sepulveda

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 15:38:32