Spark中在线(增量)逻辑回归的实现困境及可行方案咨询
Spark逻辑回归增量训练的现状与局限
我来梳理下Spark里逻辑回归增量训练的现状和存在的问题:
基于RDD的MLlib API:
这里确实有StreamingLogisticRegressionWithSGD类专门支持增量训练,但这个类已经被弃用了,而且功能短板很明显——比如无法访问模型的系数,也没办法输出概率结果,实际使用中会遇到很多限制。基于DataFrame的ML API:
目前ML模块里只有LogisticRegression类,它只提供了批量训练的fit()方法,完全不支持模型保存、重新加载,更没有增量训练的模式,显然没法满足增量训练的场景需求。
内容的提问来源于stack exchange,提问作者S Leon
相关产品推荐
相关产品推荐

