加载中...
过拟合指模型在训练数据上表现极好,但在新数据上泛化性能差,本质是模型把训练集的噪声和偶然规律当成真实模式来学习了。它是机器学习实践中最常见的问题之一,防止过拟合贯穿整个模型设计流程。

| 类型 | 机器学习核心问题 |
| 对立概念 | 欠拟合(underfitting) |
| 常见应对方法 | Dropout、正则化、数据增强、早停 |
经典场景:你有 100 张猫图片,用一个 1 亿参数的网络来训练,模型完全可以把每张图的像素位置和标签「硬记下来」,在训练集上达到 100% 准确率,但换一张新猫图就认不出了。模型容量远超数据量是过拟合的根本原因。
更微妙的过拟合:在验证集上反复调参、选最好的超参数组合,实质上也把验证集信息「泄露」给了模型选择过程,导致最终在独立测试集上表现不如预期。这叫超参数过拟合,是竞赛刷榜时的常见陷阱。[1]
工程上对抗过拟合有成熟的武器库:
值得注意的是,超大型语言模型(如 GPT-4 级别)在海量数据上训练后,过拟合反而不是主要问题,欠拟合(模型没学够)更常见。

| 类型 | 机器学习核心问题 |
| 对立概念 | 欠拟合(underfitting) |
| 常见应对方法 | Dropout、正则化、数据增强、早停 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧