如何在同一S3存储桶内复制多对象以触发ObjectCreated通知
同S3存储桶批量复制触发Lambda优化方案
核心思路
AWS CLI的aws s3 cp和aws s3 sync原生支持同存储桶复制,本质是调用S3服务端COPY接口,不会占用本地带宽,且默认开启并发请求,比你当前串行执行的Python脚本效率高很多。
方案1:批量匹配复制(适配你当前的场景)
你需要匹配data/前缀下所有包含mystring的对象,直接执行以下命令即可,将<你的桶名>替换为实际的桶名:
aws s3 cp s3://<你的桶名>/ s3://<你的桶名>/ \ --recursive \ --prefix "data/" \ --exclude "*" \ --include "*mystring*"
参数说明
--recursive:遍历指定前缀下的所有对象--exclude "*":先排除所有对象,后续再按规则匹配需要的对象--include "*mystring*":匹配所有名称包含mystring的对象,注意exclude参数必须写在include之前才会生效- 源和目标路径都写同一个桶名,CLI会自动调用S3服务端复制能力
性能调优
默认CLI最多同时发起10个复制请求,你可以通过--max-concurrent-requests参数调大并发数进一步提速,例如调整为20并发:
aws s3 cp s3://<你的桶名>/ s3://<你的桶名>/ \ --recursive \ --prefix "data/" \ --exclude "*" \ --include "*mystring*" \ --max-concurrent-requests 20
方案2:增量同步场景用s3 sync
如果后续需要重复执行该操作,只复制新增/变更的符合条件的对象,可以使用sync命令,参数规则和cp一致:
aws s3 sync s3://<你的桶名>/ s3://<你的桶名>/ \ --prefix "data/" \ --exclude "*" \ --include "*mystring*"
sync会对比源和目标对象的大小、修改时间,只复制存在差异的对象,避免重复触发Lambda处理已经处理过的文件。
注意事项
- 若需要保留原对象的元数据、标签、ACL等配置,可以加上
--metadata-directive COPY参数 - 正式执行前可以加上
--dryrun参数试运行,输出会列出所有待复制的对象,确认匹配规则无误后再去掉该参数执行 - 同桶COPY操作会正常触发
s3:ObjectCreated:*类事件,和新上传对象的触发逻辑完全一致,你现有的Lambda函数可以正常被触发
内容的提问来源于stack exchange,提问作者Arch Desai
相关产品推荐
相关产品推荐

