You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Aurora MySQL多表关联并同步至DynamoDB单表方案咨询

MySQL一对多表与DynamoDB的同步实现方案

1. AWS Glue ETL同步方案

  • 用Glue Crawler扫描你的两张MySQL表,自动生成数据目录,省去手动定义表结构的麻烦
  • 创建Glue ETL作业,用Python或Spark SQL写处理逻辑:
    • 按id关联主表和子表
    • 把子表的date和score聚合打包成数组,和主表的status等字段组合成目标结构
    • 将处理后的数据写入DynamoDB,用id作为分区键
  • 可以设置作业定时触发(比如每小时一次)做全量同步,也可以结合MySQL binlog实现增量同步

2. 基于Binlog的实时增量同步

  • 用Debezium捕获MySQL的binlog变更(插入、更新、删除操作都能抓)
  • 把binlog事件转发到Kafka队列缓存
  • 写个Kafka消费者(用Lambda或者ECS服务都行)来消费消息:
    • 主表有变更时,查询子表对应id的最新数据,合并后更新DynamoDB
    • 子表有变更时,根据id找到DynamoDB里的对应记录,用UpdateExpression修改scores数组(新增、修改或删除对应元素)
  • 先通过Glue或Data Pipeline做一次全量迁移,之后用这个方案做实时增量同步

3. 自定义Lambda触发的定时同步

  • 给MySQL的两张表加AFTER INSERT/UPDATE/DELETE触发器,把变更记录写到一张中间表
  • 用CloudWatch Events定时触发Lambda,读取中间表的未处理记录
  • Lambda里执行关联查询,合并主表和子表数据后更新DynamoDB
  • 一定要做幂等处理,比如用变更记录的唯一ID做标记,避免重复同步

核心注意点

  • 幂等性:所有同步操作必须保证重复执行不会搞乱数据,比如用每条变更的唯一标识去重
  • 性能优化:给MySQL子表的id字段加索引,避免关联时全表扫描;DynamoDB更新时用UpdateExpression直接修改数组元素,别全量覆盖整个记录
  • 错误重试:同步失败的任务可以放到SQS里,后续自动重试,避免数据丢失

内容的提问来源于stack exchange,提问作者Jeet Udaiyar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 02:50:40