You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

克隆并拟合RandomizedSearchCV后fold间随机化失效问题排查

嵌套CV循环中fold间超参数采样重复问题

我构建了一个基础嵌套CV循环,外层循环遍历内层模型调优步骤。原本预期每个fold会抽取不同的超参数随机样本,但下面的示例中,每个fold最终采样的参数完全相同。

导入库并生成数据集

from sklearn.model_selection import RandomizedSearchCV, KFold, cross_validate
from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import make_classification
from sklearn.base import clone

from scipy.stats import uniform
import numpy as np

X, y = make_classification(n_features=10, random_state=np.random.RandomState(0))

嵌套CV循环

# 用于调优随机森林
rf_tuner = RandomizedSearchCV(
    RandomForestClassifier(random_state=np.random.RandomState(0)),
    param_distributions=dict(min_samples_split=uniform(0.1, 0.9)),
    n_iter=5,
    cv=KFold(n_splits=2, shuffle=False),
    random_state=np.random.RandomState(0),
    n_jobs=1,
)

# 嵌套CV
for trn_idx, tst_idx in KFold(3).split(X, y):
    # 克隆后的对象cloned与rf_tuner共享同一RNG
    cloned = clone(rf_tuner)
    
    # 此操作应该会消耗rf_tuner的RNG状态
    cloned.fit(X[trn_idx], y[trn_idx])
    
    # 输出当前fold中采样的超参数值
    display(cloned.cv_results_['params'])

    # <嵌套CV的其他代码,未展示>

输出结果

Fold 1/3:
[{'min_samples_split': 0.593},
 {'min_samples_split': 0.743},
 {'min_samples_split': 0.642},
 {'min_samples_split': 0.590},
 {'min_samples_split': 0.481}]

Fold 2/3:
[{'min_samples_split': 0.593},
 {'min_samples_split': 0.743},
 {'min_samples_split': 0.642},
 {'min_samples_split': 0.590},
 {'min_samples_split': 0.481}]

Fold 3/3:
[{'min_samples_split': 0.593},
 {'min_samples_split': 0.743},
 {'min_samples_split': 0.642},
 {'min_samples_split': 0.590},
 {'min_samples_split': 0.481}]

我先实例化了一个包含RandomForestClassifier的RandomizedSearchCV,并将搜索器的random_state设置为np.random.RandomState(0)。

在外层循环的每次迭代中,我克隆该搜索对象并执行fit操作——按照预期,克隆体应该和原对象使用同一个RNG,每次迭代都会修改RNG状态。因此每次循环应该生成不同的超参数样本,但如上所示,每次迭代采样的超参数完全相同,这说明每次循环都使用了未修改的初始RNG状态。

scikit-learn文档指出,估算器的克隆体共享同一个随机状态实例:

b = clone(a) [...] 调用a.fit会消耗b的RNG,调用b.fit也会消耗a的RNG,因为它们是同一个实例

为什么fold之间没有出现预期的随机化?


更新

已采纳的答案说明,RNG仅被复制而非修改。

如果要在fold间实现随机化同时保持脚本可复现,一种方法是移除搜索对象的random_state参数,改为在运行嵌套CV前全局设置随机种子。

我认为更规范的方法是实例化一个带固定种子的RNG rng=np.random.RandomState(0),然后在每个fold中设置由该RNG生成的新随机种子:

cloned.set_params(**dict(
  estimator__random_state=rng.randint(10**9),
  random_state=rng.randint(10**9),
))

内容的提问来源于stack exchange,提问作者MuhammedYunus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.30 21:13:19