AWS Glue作业日志命名规则咨询:文件名生成逻辑与批量识别方法
AWS Glue作业日志文件命名规则说明
- AWS Glue作业的日志文件名不存在你假设的
[account_id]+[virt_machine_id]+[glue-job-name]+[year]+[month]+[day]+[HHMMSS]这类固定拼接格式,每次执行生成的文件名确实是无明显关联的随机字符串。 - 若要筛选同一作业、指定年月的日志,无需依赖文件名,可通过以下两种方式实现:
- S3存储路径筛选:Glue作业日志默认存储路径为
s3://aws-glue-assets-[account-id]-[region]/logs/job/[job-name]/[run-id]/,路径中已明确包含作业名。你可以通过S3的前缀筛选功能,指定前缀为logs/job/[目标作业名]/,再结合文件的LastModified时间属性,筛选出对应年月的日志文件。 - CloudWatch Logs筛选:Glue作业日志会同步到CloudWatch Logs中,日志组会按作业名进行分组,直接进入对应作业的日志组,通过时间范围筛选即可快速定位指定年月的所有日志。
- S3存储路径筛选:Glue作业日志默认存储路径为
内容的提问来源于stack exchange,提问作者Mike
相关产品推荐
相关产品推荐

