如何将Featuretools集成到含GridSearchCV的机器学习流程中?
Featuretools集成到GridSearchCV流水线的数据泄露问题与方案探讨
我正在探索将Featuretools集成到机器学习流水线中,用于从数据框(Df)生成新特征。当前使用内嵌Pipeline的GridSearchCV,但Featuretools会生成如STD(column)这类列聚合特征,担心存在数据泄露问题,而官方FAQ给出的解决方案不匹配现有Pipeline结构。
以下是我考虑的几种方案:
- 方案0:希望直接将Featuretools集成到Pipeline中,但似乎二者不兼容。理想流程是:用折内训练数据构建特征,转换折内测试数据,重复K次;在GridSearchCV的
Refit=True阶段,用全部数据构建特征。若有可行案例欢迎分享。 - 方案1:切换至非流水线内嵌的手动CV结构,每个折中用训练数据构建新特征,再转换测试数据,重复K次,最终用全部数据构建最终模型。这是最安全的方案,但存在耗时、复杂度高的缺点。
- 方案2:用全部数据运行Featuretools,忽略数据泄露风险。我并不倾向此方案,但项目官方示例均采用合并训练与测试数据生成特征,再划分数据集建模的方式。若开发者认可此方式,或许可以尝试。
想了解各位关于Featuretools的实践经验,望不吝赐教。
内容的提问来源于stack exchange,提问作者Ali Kılınç
相关产品推荐
相关产品推荐

