如何更新Google Cloud Data Fusion复制作业适配SQL Server表结构变更?
Google Cloud Data Fusion 复制作业适配表结构更新方案
开启Schema自动检测功能
编辑现有作业的源数据库连接器配置,找到「自动检测Schema」或「刷新Schema」的开关并开启。部分支持CDC(变更数据捕获)的连接器可以设置元数据刷新间隔(比如每1小时),这样新增列、字段类型变更会被自动识别,作业在下一次运行时就会同步新结构的增量数据。手动刷新元数据
不用停止作业,进入作业编辑界面,找到源表的元数据配置模块,点击「Refresh Schema」按钮。刷新完成后保存作业,后续运行就会使用更新后的表结构同步数据。如果是新增表:如果作业是用通配符/正则匹配表名,刷新元数据后会自动发现新增表;如果是固定表列表,手动把新增表添加到配置里即可,添加后作业会从当前时间点开始同步该表的增量数据,不会触发全量复制。调整同步模式与结构变更捕获
确保作业使用CDC模式或增量快照模式,而非全量快照。如果源数据库支持(比如PostgreSQL逻辑复制、MySQL binlog),开启结构变更捕获功能,这样表结构的修改会被实时捕获并同步到目标端,无需手动干预。避免全量复制的关键
绝对不要删除作业的checkpoint或状态数据,Data Fusion靠这些记录已同步的位置,保留它们就能保证后续同步是增量的。编辑作业时只修改表结构相关配置,不要重置同步起始时间或清空状态,否则会触发全量重跑。
内容的提问来源于stack exchange,提问作者Alessio Innocenzi
相关产品推荐
相关产品推荐

