加载中...

早停(Early Stopping)是一种简单的正则化与训练控制策略:训练过程中持续监控验证集指标,当指标在连续若干次评估(耐心值,patience)内不再改善时提前终止训练,并回退到验证表现最好的检查点。
训练误差通常单调下降,而验证误差往往先降后升,上升点即过拟合的开始。早停相当于在泛化最好的时刻定格模型,从优化角度看,限制训练步数等效于对参数施加了某种约束,因此具有正则化效果。
关键超参数是评估频率、耐心值与最小改善幅度;需配合模型检查点保存使用。主流框架(如 PyTorch Lightning、Keras、Hugging Face Trainer)均内置 EarlyStopping 回调。
验证集必须与测试集独立,否则会造成信息泄漏;指标本身有噪声,耐心值过小易过早停止。在大模型预训练中因数据远未过拟合、训练预算固定,早停较少使用,但在下游微调与传统机器学习中仍是标准做法。

登录 后参与讨论
暂无讨论,来发表第一条评论吧