Autogluon多模态训练Sanity Checking耗时过长,求跳过或优化方法
解决Autogluon多模态训练中Sanity Checking耗时过长的问题
跳过Sanity Checking的直接方法
在fit方法中添加参数关闭数据校验,直接跳过该步骤:
predictor.fit(train_data, sanity_check=False)
该参数默认值为True,关闭后会省去对全量特征和文本数据的校验流程,大幅缩短初始化时间。
其他性能优化方案
- 精简结构化特征:1258个特征中大概率存在冗余或低信息密度的特征,可先通过方差过滤(移除方差趋近于0的特征)、相关性分析(剔除高度相关的特征)等方式减少特征数量,降低整体计算负载。
- 轻量化文本处理配置:
- 若文本列内容过长,可提前截断至模型适配的token长度(如512个token),避免超长文本带来的额外校验和计算;
- 初始化
MultiModalPredictor时指定轻量级预训练文本模型,替代默认的大模型:predictor = MultiModalPredictor( label='finallikleyTOAST', hyperparameters={ 'model.text.checkpoint_name': 'distilbert-base-uncased' } )
- 调整训练资源参数:如果硬件内存有限,可降低batch size避免内存瓶颈导致的流程卡顿:
predictor.fit( train_data, hyperparameters={ 'optimization.batch_size': 16 } )
内容的提问来源于stack exchange,提问作者Glinty
相关产品推荐
相关产品推荐

