Coursera吴恩达机器学习课程:Quadratic regression中房价随x下降的原因问询
嘿,这个问题我当初跟着Andrew NG学机器学习的时候也纠结过!咱们一步步拆解为啥会出现这种情况:
二次回归拟合房价时预测值下降的核心原因
二次函数的数学本质决定了趋势走向
咱们用的二次回归方程是y = ax² + bx + c,如果拟合出来的二次项系数a是负数,那这个抛物线就是开口向下的。抛物线会有一个顶点(最高点),当自变量x超过顶点对应的数值后,函数值必然会持续下降。在房价拟合的场景里,模型从训练数据中学到的二次项系数为负,自然就会在x突破顶点后给出下降的预测。训练数据的范围限制了模型的“认知”
你回忆下NG课程里的训练数据集,房子的特征(比如面积)大概率只覆盖到某个上限(比如最多2000平方英尺),没有更大面积的样本数据。模型只能在它见过的数据范围内拟合出相对合理的趋势,一旦超出这个范围,它就只能顺着二次函数的固有趋势往下走——但现实中更大的房子房价通常不会下跌,只是模型没见过这些数据,没法做出正确的外推。模型的表达能力不足以覆盖真实趋势
二次模型是我们人为选择的简单模型,它的表达能力有限。真实的房价趋势可能是:面积增大时房价持续上涨,只是增速逐渐放缓(比如接近线性但斜率变小),但绝不会掉头下降。二次模型没办法捕捉这种“缓涨但不降”的趋势,只能用抛物线来近似,超出训练范围后就会暴露自身的局限性。
如果想避免这个问题,你可以试试这些思路:
- 对自变量做截断,只在训练数据覆盖的范围内进行预测;
- 尝试更高次的多项式回归,但记得加入正则化(L1/L2)防止过拟合;
- 换用更灵活的模型(比如决策树、随机森林),它们在处理非线性趋势时的外推表现通常更贴合真实场景。
内容的提问来源于stack exchange,提问作者Akshat
相关产品推荐
相关产品推荐

