数据仓库是否适合存储时序数据?非星型schema独立表能否存入数仓?
问题解答
1. 数据仓库是否适合存储时序数据?
完全适合。当前主流云原生数仓(Snowflake、BigQuery、Redshift、MaxCompute等)都针对时序数据做了专门优化:比如支持按时间字段分区/分桶、列式存储大幅提升时间范围查询性能、内置时序计算函数(滑动窗口、时间对齐、环比同比计算等),完全可以覆盖你的使用场景。
而且你后续需要用这份时序数据和数仓内部的业务数据做关联分析,存在数仓里可以避免跨库查询的性能损耗和运维成本,比存在专门的时序数据库更适配你的需求。
2. 类似的独立表能否存储在数据仓库中?
当然可以。数仓并没有强制要求所有表都必须经过维度建模,你完全可以将这份第三方采集的行业数据作为独立的公共数据表存储,只要做好对应的元数据登记、权限管控、生命周期规则配置即可。
一般团队的数仓都会做分层设计,你可以把这类外部数据放在贴源层或者公共数据层,和内部业务建模的表分开管理,后续计算每日市场份额时直接关联查询即可,使用非常灵活。
3. 存入数据仓库的表必须属于星型schema的一部分吗?
不需要。星型schema是维度建模里面向业务事务分析的一种经典建模方式,是数仓的可选建模规范,而非强制要求。
数仓里可以存储多种类型的表:原始贴源表、临时计算中间表、算法特征表、外部同步的行业/公共数据表等,这些都可以完全独立于现有的星型schema存在,只要符合你团队的数仓管理规范即可,不需要为了适配星型schema强行做不需要的关联改造。
内容的提问来源于stack exchange,提问作者VE88
相关产品推荐
相关产品推荐

