如何将S3存储桶对象元数据添加至AWS Bedrock知识库?
基于S3元数据配置Bedrock RAG的OpenSearch映射方案
一、更新现有S3数据源以纳入元数据映射
- 打开AWS Bedrock控制台,进入知识库页面找到你的目标知识库。
- 切换到数据源标签,选中已配置的S3数据源,点击编辑按钮。
- 在数据提取设置区域,找到元数据提取模块:
- 勾选「提取S3对象元数据」选项;
- 列出需要提取的元数据键(支持S3内置元数据如
Content-Type,或自定义元数据如x-amz-meta-category); - 标记需要用于RAG过滤的字段,确保它们被设为可检索字段。
- 保存配置后,Bedrock会自动触发同步任务,重新处理S3对象并将指定元数据字段添加到OpenSearch Serverless的索引映射中。
- 同步完成后,在RAG查询时可通过
filter参数调用这些元数据(比如调用Retrieve API时指定filter={"category": "tech"})。
二、创建新S3数据源并配置元数据映射
- 在Bedrock控制台的知识库页面,要么新建知识库,要么进入现有知识库的数据源管理页,点击添加数据源并选择S3。
- 完成S3存储桶路径、IAM角色等基础配置后,进入数据提取设置:
- 开启「元数据提取」,明确列出需要纳入映射的元数据键;
- 为每个元数据字段指定类型(如字符串、数值,Bedrock会自动匹配OpenSearch的映射类型);
- 标记需要用于过滤的字段,确保它们被加入可搜索映射。
- 启动同步后,Bedrock会自动在OpenSearch Serverless集群中创建包含指定元数据字段的索引映射,无需手动修改集群配置。
关键注意事项
- OpenSearch Serverless的映射由Bedrock自动维护,无需你直接操作集群。只要在数据源配置中指定了元数据,同步时Bedrock会自动更新索引映射结构。
- S3自定义元数据必须以
x-amz-meta-为前缀,Bedrock会自动去除前缀后将字段名存入索引(比如x-amz-meta-author会转为author字段)。 - 同步完成后,可通过Bedrock的检索测试功能验证元数据是否正确索引,比如添加过滤条件测试返回结果是否符合预期。
内容的提问来源于stack exchange,提问作者Makarand
相关产品推荐
相关产品推荐

