如何从Databricks触发/编排存储过程?含成本优化思路
Databricks 10.x ETL流水线架构及成本优化方案
ETL流程
- 从数据湖读取数据
- 将数据帧加载至Azure数据库
- 待处理项:将数据合并至数据模型(通过SQL存储过程)
- 更新水位线(Watermark)
核心问题
Databricks直接运行SQL存储过程时成本过高,希望通过队列/触发机制执行该步骤,且不考虑使用ADF方案。
短期优化方案
使用最低配置的集群执行SQL存储过程步骤,以此临时降低运行成本。
潜在长期方案
计划在日志表上创建触发器,由日志表事件触发合并语句执行,目前评估该方案具备可行性,实施完成后将更新进展。
内容的提问来源于stack exchange,提问作者BI Dude
相关产品推荐
相关产品推荐

