Amazon RDS 1亿行大表执行ALTER新增列操作失败如何解决?
可行解决方案
1. 优先尝试INSTANT DDL(秒级完成,无数据迁移)
首先确认你的RDS MySQL版本,若为8.0.12及以上版本,支持INSTANT算法新增可空、带默认值的列,无需扫描全表、无需重建表,执行后秒级生效:
ALTER TABLE job_assets ADD COLUMN browser varchar(10) DEFAULT NULL ALGORITHM=INSTANT LOCK=NONE;
注意原语句中ADD COLUMN子句后多余的逗号会导致语法解析异常,执行时请去掉ALGORITHM、LOCK前的逗号。
2. 处理MySQL 5.7版本的报错问题
如果是5.7版本不支持INSTANT DDL,先针对两个报错逐一排查调整:
- 解决
ERROR 1317中断问题:
调大innodb_online_alter_log_max_size参数,默认128M的空间不足以承载大表DDL期间的增量写入日志,可根据业务写入QPS调整为1G~4G,调整后在业务低峰期执行操作,避免DDL过程中日志占满导致任务被中断。 - 解决
ERROR 1034索引文件错误问题:
该报错90%以上是因为DDL过程中临时目录空间不足:- 先确认RDS实例剩余存储空间≥当前
job_assets表的大小+索引总大小,INPLACE ALTER需要预留等额临时空间用于重建表 - 检查RDS参数组中
tmpdir配置,确保临时目录指向空间充足的数据卷目录(RDS默认/rdsdbdata/tmp,不要使用系统根分区作为临时目录) - 先执行
CHECK TABLE job_assets;确认表没有物理损坏,InnoDB表无需执行REPAIR操作,如果检查返回损坏,可从最近的快照恢复数据后再操作。
- 先确认RDS实例剩余存储空间≥当前
3. 兜底操作建议
如果调整参数后还是执行失败,可以先在同规格的只读副本上执行ALTER操作,验证耗时、参数合理性,确认无问题后再对主库执行操作,执行期间暂停非必要的批量写入任务,降低DDL压力。
内容的提问来源于stack exchange,提问作者Scobee
相关产品推荐
相关产品推荐

