本地环境中能否使用TFX实现AutoML并将模型部署到本地目录?
本地环境使用TFX开展AutoML的可行方案
完全可以在本地环境基于TFX跑通AutoML全流程,不需要依赖Kubeflow或GCP的云端服务,具体实操方式如下:
- 环境准备:优先选择Python 3.8~3.10版本(和TFX稳定版兼容性最好),直接通过pip安装稳定版TFX即可,安装命令参考
pip install tfx==1.14.0,不需要额外部署K8s集群、云服务SDK这类云端相关组件。 - 流程编排:TFX原生提供
LocalDagRunner本地编排器,直接替换掉云端场景用的KubeflowDagRunner,就能在本地调度所有TFX组件跑完整DAG流程,所有中间产物(数据统计报告、数据Schema、超参搜索记录、模型评估结果等)都会默认写入你指定的本地工作目录,不需要对接云存储服务。 - AutoML能力落地:TFX内置的组件完全覆盖本地AutoML需求:用
ExampleGen、SchemaGen、Transform组件自动完成数据校验、特征工程流程;用Tuner组件可以本地执行超参数搜索(支持随机搜索、贝叶斯搜索等常用策略),不需要调用GCP的云端调优接口;你也可以在自定义Trainer逻辑里加入模型结构遍历规则,根据验证集指标自动筛选最优模型结构,实现全自动模型选型。 - 模型本地导出:训练完成后使用内置的
Pusher组件做模型推送,只需要将推送目标的serving_directory参数配置为你想要存放模型的本地路径,组件就会自动把经过验证最优的模型导出为标准可部署格式,存到指定本地目录,不需要对接云端模型部署服务。
注意:如果本地处理的数据集规模较大,提前给运行环境分配足够的CPU、内存资源即可,本地运行的组件逻辑和云端完全一致,不存在功能阉割。
内容的提问来源于stack exchange,提问作者Shisui Otsutsuki
相关产品推荐
相关产品推荐

