Azure:使用SplitSkill无法复现手动文档拆分效果的咨询
Azure RAG手动拆分与SDK程序化配置的Chunking差异问题
我正将Azure中的RAG解决方案从手动配置转为使用Azure Python SDK进行程序化配置。我的容器中有一个PDF文件,手动设置chunking为256时,创建的索引下文档数为401;但使用如下自定义技能集时:
split_skill = SplitSkill( name="split", description="Split skill to chunk documents", context="/document", text_split_mode="pages", default_language_code="en", maximum_page_length=300, # why cannot this be set to 256 if I can do this with a manual setup? page_overlap_length=30, inputs=[ InputFieldMappingEntry(name="text", source="/document/content"), ], outputs=[ OutputFieldMappingEntry(name="textItems", target_name="pages") ], )
得到的文档数为271。我希望尽可能复现手动拆分配置,因为该配置已带来良好性能,请问我遗漏了什么?或者能否告知手动拆分的默认配置?
2月22日编辑:
回复@JayashankarGS:
根据文档,minimum值需设为300。RAG中的chunking与拆分技能集中的maximumPageLength并非完全相同。
在我看来,maximum_page_length就是chunking_size。但正如你所说,目前通过SplitSkill无法设置小于300的chunk大小...
内容的提问来源于stack exchange,提问作者Mike B
相关产品推荐
相关产品推荐

