如何使用cuml执行网格搜索时避免出现数据类型错误
问题原因
- 你使用的21.10版本cuml的
GridSearchCV_cu底层仍会调用scikit-learn的目标类型校验逻辑,sklearn的校验函数会尝试将输入的y隐式转换为CPU端numpy数组,但cudf Series存储在显存中,默认禁止隐式转换到主机内存,因此触发报错。 - 直接训练模型无报错是因为cuml原生模型接口原生支持cudf数据类型,不需要走sklearn的校验逻辑。
- 把数据转成内存中运行时可以正常执行,但数据需要在显存和内存之间反复拷贝,因此速度远低于纯GPU执行,甚至不如CPU。
可行解决方案
方案1:显式指定GPU端交叉验证分割器(最推荐,全程GPU执行无额外开销)
不要只给cv参数传整数,手动传入cuml自带的StratifiedKFold实例,跳过sklearn的自动校验逻辑:
from cuml.model_selection import StratifiedKFold X_cudf_train = cudf.DataFrame.from_pandas(X_train) X_cudf_test = cudf.DataFrame.from_pandas(X_test) y_cudf_train = cudf.Series(y_train.values) RF_classifier_cu = RandomForestClassifier_cu(random_state = 123) # 显式指定cuml的GPU端分层折分割器 cv = StratifiedKFold(n_splits=3) grid_search_RF_cu = GridSearchCV_cu(estimator=RF_classifier_cu, param_grid=grid_RF, cv=cv, verbose=1) grid_search_RF_cu.fit(X_cudf_train,y_cudf_train) print(grid_search_RF_cu.best_params_)
方案2:将标签转为CuPy数组
将y从cudf Series转为CuPy显存数组,适配校验逻辑:
import cupy as cp y_cupy_train = cp.asarray(y_train.values) grid_search_RF_cu = GridSearchCV_cu(estimator=RF_classifier_cu, param_grid=grid_RF, cv=3, verbose=1) grid_search_RF_cu.fit(X_cudf_train,y_cupy_train)
方案3:临时将标签转为主机端数组(适合标签规模极小的场景)
标签数据本身维度很低,转CPU不会产生明显性能损耗,可快速解决问题:
grid_search_RF_cu.fit(X_cudf_train,y_cudf_train.to_array())
内容的提问来源于stack exchange,提问作者ARandomeUser
相关产品推荐
相关产品推荐

