You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何BQ二次快照仍占用原表完整存储量?技术问询

BigQuery快照未呈现差异存储的原因分析

问题场景

创建分区表后生成第一次快照,仅修改1月分区内部分行的value字段(将UUID替换为另一个UUID),生成的第二次快照逻辑字节与物理字节均与第一次快照大小一致,未仅存储差异数据。

核心原因解析

  • 逻辑字节的计算逻辑:逻辑字节统计的是表中所有数据的总大小,与存储是否共享无关。本次操作仅将部分行的value字段从一个UUID替换为另一个UUID,每行数据的字节长度未发生变化,且表的总行数保持不变,因此两次快照的逻辑字节总量完全一致。

  • 物理字节的写时复制机制:BigQuery快照采用写时复制(Copy-On-Write)实现,仅会为被修改的数据生成新的存储块,未修改的分区(如示例中的2月分区)会与源表/旧快照共享存储。但本次修改的1月分区中,被更新行的字节大小未改变,新生成的1月分区存储块大小与旧快照中的1月分区块大小完全一致,加上共享的2月分区存储块,最终两次快照的物理字节总量也保持一致。

  • 快照并非增量差异存储:BigQuery的SNAPSHOT TABLE本质是创建源表在指定时间点的只读全量镜像,而非基于旧快照的增量差异存储。无论源表修改范围大小,新快照都会完整映射源表当前的全量数据状态,仅在物理层通过共享未修改块优化存储,不会主动计算并仅存储与旧快照的差异内容。

内容的提问来源于stack exchange,提问作者bsauce

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 07:31:20