You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用cuml执行网格搜索时避免出现数据类型错误

问题原因
  • 你使用的21.10版本cuml的GridSearchCV_cu底层仍会调用scikit-learn的目标类型校验逻辑,sklearn的校验函数会尝试将输入的y隐式转换为CPU端numpy数组,但cudf Series存储在显存中,默认禁止隐式转换到主机内存,因此触发报错。
  • 直接训练模型无报错是因为cuml原生模型接口原生支持cudf数据类型,不需要走sklearn的校验逻辑。
  • 把数据转成内存中运行时可以正常执行,但数据需要在显存和内存之间反复拷贝,因此速度远低于纯GPU执行,甚至不如CPU。
可行解决方案

方案1:显式指定GPU端交叉验证分割器(最推荐,全程GPU执行无额外开销)

不要只给cv参数传整数,手动传入cuml自带的StratifiedKFold实例,跳过sklearn的自动校验逻辑:

from cuml.model_selection import StratifiedKFold

X_cudf_train = cudf.DataFrame.from_pandas(X_train)
X_cudf_test = cudf.DataFrame.from_pandas(X_test)
y_cudf_train = cudf.Series(y_train.values)

RF_classifier_cu = RandomForestClassifier_cu(random_state = 123)
# 显式指定cuml的GPU端分层折分割器
cv = StratifiedKFold(n_splits=3)
grid_search_RF_cu = GridSearchCV_cu(estimator=RF_classifier_cu, param_grid=grid_RF, cv=cv, verbose=1)
grid_search_RF_cu.fit(X_cudf_train,y_cudf_train)
print(grid_search_RF_cu.best_params_)

方案2:将标签转为CuPy数组

将y从cudf Series转为CuPy显存数组,适配校验逻辑:

import cupy as cp

y_cupy_train = cp.asarray(y_train.values)
grid_search_RF_cu = GridSearchCV_cu(estimator=RF_classifier_cu, param_grid=grid_RF, cv=3, verbose=1)
grid_search_RF_cu.fit(X_cudf_train,y_cupy_train)

方案3:临时将标签转为主机端数组(适合标签规模极小的场景)

标签数据本身维度很低,转CPU不会产生明显性能损耗,可快速解决问题:

grid_search_RF_cu.fit(X_cudf_train,y_cudf_train.to_array())

内容的提问来源于stack exchange,提问作者ARandomeUser

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 19:45:07