如何通过Microsoft Fabric Dataflow Gen2批量加载Parquet文件至Lakehouse青铜层
批量处理Parquet文件加载至Lakehouse青铜层方案
1. 批量解析Parquet内容
- 确认当前数据集已包含所有目标Parquet文件的
Content(二进制数据列)和Name(文件名)。 - 选中
Content列,点击顶部菜单栏的转换 → 解析 → Parquet。这一步会自动遍历所有行,将每个文件的二进制内容解析为对应结构化列,无需逐行手动处理。
2. 处理元数据(可选)
- 若需要溯源数据来源,保留
Name列作为元数据字段;不需要则直接删除该列。
3. 加载到Lakehouse青铜层
- 完成解析后,点击加载数据,选择目标Lakehouse的青铜层表(支持新建表或追加到现有表)。
- 根据业务需求选择替换或追加模式,确认列映射正确后启动加载任务。
4. 自动化与增量优化(可选)
- 设置Dataflow Gen2的定时刷新,实现定期自动检测并加载存储账户中的新文件。
- 若要增量加载,可通过
Name列或文件修改时间作为筛选条件,仅处理新增文件,避免重复加载。
内容的提问来源于stack exchange,提问作者Danny Verdel
相关产品推荐
相关产品推荐

