You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure:使用SplitSkill无法复现手动文档拆分效果的咨询

Azure RAG手动拆分与SDK程序化配置的Chunking差异问题

我正将Azure中的RAG解决方案从手动配置转为使用Azure Python SDK进行程序化配置。我的容器中有一个PDF文件,手动设置chunking为256时,创建的索引下文档数为401;但使用如下自定义技能集时:

split_skill = SplitSkill(
    name="split",
    description="Split skill to chunk documents",
    context="/document",
    text_split_mode="pages",
    default_language_code="en",
    maximum_page_length=300,  # why cannot this be set to 256 if I can do this with a manual setup?
    page_overlap_length=30,
    inputs=[  
        InputFieldMappingEntry(name="text", source="/document/content"),  
    ],  
    outputs=[  
        OutputFieldMappingEntry(name="textItems", target_name="pages")  
    ],
)

得到的文档数为271。我希望尽可能复现手动拆分配置,因为该配置已带来良好性能,请问我遗漏了什么?或者能否告知手动拆分的默认配置?


2月22日编辑:

回复@JayashankarGS:

根据文档,minimum值需设为300。RAG中的chunking与拆分技能集中的maximumPageLength并非完全相同。

在我看来,maximum_page_length就是chunking_size。但正如你所说,目前通过SplitSkill无法设置小于300的chunk大小...


内容的提问来源于stack exchange,提问作者Mike B

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.29 19:58:16