可预测缺失参数的ML模型类型及对应机器学习范式是什么?
这类技术的官方通用名称
这类支持任意字段作为输入、补全全量缺失字段的机器学习技术,根据实现路径不同有两类主流官方命名:
- 深度学习范畴的标准名称为 表格掩码建模(Tabular Masked Modeling),属于自监督学习在表格数据领域的分支,和NLP领域的掩码语言模型(MLM)技术逻辑同源:训练阶段会随机掩码掉表格样本的任意部分字段,让模型学习通过可见字段预测掩码内容,训练完成后自然支持任意可见字段组合输入、输出所有缺失字段的预测结果。你示例中输入
(FirstName: John, LastName: Doe, Sex: M, Height: (5,10))预测其他字段的需求,用TabMAE、掩码版TabNet等这类模型都可以直接实现,不需要为每个缺失字段单独训练模型,也能同时处理离散字段(如HairColor、EyeColor)和连续字段(如Weight)的预测。 - 传统机器学习范畴对应的方案是 多输出多任务预测模型,不过这类方案需要提前固定所有待预测的输出字段,无法灵活适配训练阶段未定义的输入字段组合,泛用性远低于深度学习范畴的表格掩码建模方案。
补充说明:如果你的场景只需要处理固定的字段缺失补全,不需要支持任意输入字段组合,也可以直接用常规的表格缺失值插补(Tabular Imputation)类方案,包括KNN插补、随机森林插补等传统方案都可以实现需求,部署成本更低。
内容的提问来源于stack exchange,提问作者Martin Bocanegra
相关产品推荐
相关产品推荐

