You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

CLU如何自动划分语句?其划分规则为何无随机性?

CLU自动划分训练集与测试集的逻辑
  • CLU的自动数据集划分不是随机分配的,而是采用固定的确定性规则归类语句,这就是多次训练得分完全一致的原因。
  • 具体来说,每条语句会根据自身内容生成一个哈希值,CLU依据这个哈希值将语句分配到训练集或测试集。这种方式能保证同一批语句每次划分的结果完全相同,不会出现随机划分带来的得分波动。
  • 它并非简单选取前x%的语句作为训练集,而是通过哈希映射实现均匀且固定的分配,既保证了数据集分布的合理性,又能让实验结果具备可重复性。

内容的提问来源于stack exchange,提问作者Martijn

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 03:10:48