机器学习肥料预测任务:非随机扩充分类数据集方法咨询
| 序号 | 温度 | 湿度 | 降雨量 | pH | N | P | K | 土壤类型 | 作物类型 | 肥料类型 |
|---|---|---|---|---|---|---|---|---|---|---|
| 0 | 24.87 | 82.84 | 295.61 | 6.59 | 4.0 | 2.0 | 2.5 | 0 | 1 | 1 |
| 1 | 28.69 | 96.65 | 178.96 | 6.08 | 4.0 | 4.0 | 4.0 | 4 | 0 | 2 |
| 2 | 20.27 | 81.64 | 270.44 | 5.01 | 4.0 | 4.0 | 2.0 | 6 | 1 | 3 |
| 3 | 25.07 | 95.02 | 192.90 | 5.55 | 2.0 | 2.1 | 3.5 | 5 | 0 | 5 |
| 4 | 25.04 | 95.90 | 174.80 | 6.18 | 2.0 | 3.9 | 2.1 | 3 | 0 | 6 |
非随机数据集扩充方法(针对肥料预测分类任务)
基于农业领域知识的插值与平滑
- 数值型特征:按「土壤类型+作物类型+肥料类型」分组,在组内现有样本的合理特征区间做线性插值。比如某组有20℃和25℃的温度样本,可生成22℃、23℃等中间值,同时参考农业常识保持温度与湿度、降雨量的关联(比如温度升高时,湿度合理降低)。
- 类别型特征:针对样本量少的土壤/作物类别,结合农业生产逻辑补充样本。比如某类土壤适合特定作物种植,就基于该组合的现有特征范围,生成符合实际种植规律的新样本。
同组相似样本的加权合成
- 对每个样本,在其同类别、同土壤-作物组合的k近邻样本中,生成加权平均的新样本。加权时优先赋予N/P/K、pH等对肥料类型影响更大的特征更高权重,而非随机分配权重,保证合成数据符合农业养分逻辑。
基于实际逻辑的特征变换与衍生
- 生成有农业意义的衍生特征,将原样本与衍生特征组合成新样本:比如计算「湿度-温度比值」「N/P/K总养分含量」「降雨量与温度的乘积」等,这类衍生特征能保留原样本的标签合理性,相当于从单一样本扩展出多维度有效样本。
- 对数值特征做小范围合理扰动:比如温度波动±1℃、湿度波动±2%,扰动幅度严格参考田间环境的真实波动范围,避免无意义的随机改动。
分组重复采样与特征细分
- 按「土壤类型+作物类型+肥料类型」分组,对组内样本重复采样时,对某一特征进行细分。比如某组有pH6.0的样本,可拆分为pH5.9、6.0、6.1的样本,其他特征保持不变,这种细分符合土壤pH的自然渐变规律。
多源合规数据融合
- 查找公开的农业田间试验数据集(如农业科研机构发布的土壤-作物-肥料匹配数据),筛选与当前数据集特征维度一致的样本,清洗后合并。注意要保证数据分布与现有数据集一致,避免引入分布偏移的样本。
内容的提问来源于stack exchange,提问作者Ukant
相关产品推荐
相关产品推荐

