加载中...
随机森林是一种集成学习算法,由布赖曼提出。它通过对样本自助采样并在每次分裂时随机选取部分特征,训练出大量彼此差异化的决策树,再以投票或平均聚合结果。它抗过拟合、可估计特征重要性,是最常用的通用机器学习模型之一。

| 类型 | 集成学习/装袋法 |
| 提出者 | 列奥·布赖曼 |
| 基学习器 | 决策树 |
| 聚合方式 | 投票或平均 |
| 随机来源 | 样本采样与特征选择 |
随机森林(Random Forest)是由列奥·布赖曼提出的一种集成学习方法,它构建多棵相互独立的决策树,并通过投票(分类)或平均(回归)综合各树预测,从而获得比单棵决策树更稳定、更准确的结果。
随机森林建立在装袋法与随机特征选择两大机制之上。装袋法对训练集进行有放回抽样,生成多个略有差异的子集分别训练树;随机特征选择则在每个节点分裂时,只从随机抽取的特征子集中挑选最优划分。两种随机性共同降低了树与树之间的相关性,使集成后的方差显著下降。
随机森林适用于分类与回归的广泛场景,如信用评分、疾病诊断、遥感分类、推荐系统的特征筛选等。由于对缺失值与异常值鲁棒、几乎不需特征缩放、又能输出特征重要性,它常被当作快速建立基线模型的首选工具,也广泛用于数据探索阶段。
问:随机森林为什么不容易过拟合?答:每棵树基于不同样本与特征子集训练,彼此误差不完全相关,聚合时正负偏差相互抵消,方差随树数增加而减小,因此整体泛化能力较强。
问:它和梯度提升树的主要区别是什么?答:随机森林并行独立训练多棵树后平均,侧重降低方差;梯度提升树串行逐棵拟合前序残差,侧重降低偏差,通常精度更高但更易过拟合、调参更敏感。

| 类型 | 集成学习/装袋法 |
| 提出者 | 列奥·布赖曼 |
| 基学习器 | 决策树 |
| 聚合方式 | 投票或平均 |
| 随机来源 | 样本采样与特征选择 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧