加载中...

交叉验证(Cross-Validation)是评估模型泛化性能与选择超参数的标准方法:将数据划分为若干互斥子集,轮流用其中一部分做验证、其余做训练,汇总各轮指标得到更稳健的性能估计。
K 折交叉验证(k-fold)把数据均分为 K 份,做 K 轮训练验证,K 常取 5 或 10;留一法(LOOCV)是 K 等于样本数的极端情形,估计偏差小但计算昂贵;分层 K 折(stratified)保持各折的类别比例,适合类别不平衡数据;时间序列数据须用按时间顺序滚动的划分,避免用未来信息预测过去。
特征选择、标准化等预处理必须放在每折内部单独拟合,否则会造成数据泄漏、高估性能;嵌套交叉验证可在调参的同时获得无偏的泛化估计。
交叉验证是机器学习实验方法论的基石,几乎所有模型比较与超参数搜索都以其为默认协议。

登录 后参与讨论
暂无讨论,来发表第一条评论吧