能否在DBT中基于多个文件构建合并的seed数据集/表?
在DBT中合并多个文件生成Seed数据集/表
先确认你的两个数据文件字段结构完全匹配(字段名、数据类型要一一对应),把它们都放在DBT项目的
seeds/目录下,比如命名成file1.csv和file2.csv。接下来在
seeds/目录里新建一个SQL文件,比如叫combined_seed.sql,用union all把两个文件的数据合并起来,代码如下:select * from {{ ref('file1') }} union all select * from {{ ref('file2') }}要是两个文件里有重复数据需要去重,把
union all换成union就行,但union all性能更高,优先用这个。(可选)如果想给合并后的seed指定表名或者存放的schema,就在
dbt_project.yml里加配置:seeds: 你的项目名称: combined_seed: +schema: 目标schema名 +alias: 合并后的表名最后运行命令生成合并后的seed:
全量刷新所有seed(包括这个合并的):dbt seed --full-refresh或者只运行这个合并的seed:
dbt seed --select combined_seed
内容的提问来源于stack exchange,提问作者Pravin Singh
相关产品推荐
相关产品推荐

