过拟合(Overfitting)是机器学习和统计学中的常见问题,指模型把训练数据(连同其中的噪声)学得过于精细,导致在新数据上表现很差。理解过拟合的成因与正则化、早停等应对方法,是训练出泛化能力强的模型的基础。

| 类型 | 机器学习 / 统计学概念 |
| 英文名 | Overfitting |
| 所属领域 | 人工智能、统计建模 |
| 典型表现 | 训练误差低、泛化误差高(低偏差高方差) |
| 相对概念 | 欠拟合(Underfitting) |
| 常见对策 | 正则化、早停、Dropout、交叉验证 |
过拟合(Overfitting)是机器学习与统计学中的一种现象:模型在训练数据上表现得几乎完美,却在没见过的新数据上表现明显变差,也就是「记住了答案,没学会规律」。
训练模型的最终目的不是复述训练集,而是对未来的、没见过的数据做出准确预测,这种能力叫「泛化」。当模型的参数过多、结构过于复杂,而训练数据又相对有限时,模型就有足够的自由度去迎合训练集里的每一个细节——包括那些纯属偶然的统计噪声。此时训练误差可以压得很低,但换一批数据就原形毕露,这就是过拟合。
从统计学角度看,过拟合的模型通常偏差小而方差大:它对训练数据贴合得很紧,但对数据的随机波动极其敏感。其本质是训练算法不知不觉地把噪声中的「假规律」写进了模型参数。理论上,只要模型足够复杂,总能完美拟合任何一份有限的数据,但这种「完美」没有意义。因此过拟合常被视为违反奥卡姆剃刀原则——在效果相近时,应当选择更简单的模型。
与之相对的是欠拟合:模型太简单,连训练数据里的真实规律都没学到,训练误差和测试误差都很高。实际建模就是在两者之间寻找平衡。
问:怎么判断模型是否过拟合?答:最常用的信号是训练集表现与验证集/测试集表现差距很大——训练误差很低而验证误差明显偏高,或者验证误差在训练后期不降反升。
问:过拟合和欠拟合有什么区别?答:过拟合是学得「太多」,把噪声也当成了规律,训练好而测试差;欠拟合是学得「太少」,连真实规律都没抓住,训练和测试都差。
问:增加训练数据一定能解决过拟合吗?答:通常有帮助,因为更多样本会稀释噪声的影响,但如果新数据质量差或分布有偏,效果有限,一般需要配合正则化、早停等手段一起使用。

| 类型 | 机器学习 / 统计学概念 |
| 英文名 | Overfitting |
| 所属领域 | 人工智能、统计建模 |
| 典型表现 | 训练误差低、泛化误差高(低偏差高方差) |
| 相对概念 | 欠拟合(Underfitting) |
| 常见对策 | 正则化、早停、Dropout、交叉验证 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧