基础知识指南

集成方法和梯度提升

集成方法结合了许多简单的模型,因此该组可以比任何单个模型做出更好的预测。

阅读时间:2分钟最后更新

概述

Gradient boosting is the most powerful of these — it builds trees one at a time, each correcting the errors of the last, and dominates real-world tabular machine learning.

深入探讨

集成基于一个简单的想法:许多弱学习器结合起来可以形成一个强学习器。两个家庭主导。 Bagging(例如随机森林)在随机样本上并行训练许多树并对它们进行平均,这主要减少方差。 Boosting 按顺序训练模型,每个模型都关注前一个模型所犯的错误,这主要是减少偏差。梯度提升将每棵新树构建为适合迄今为止损失函数的负梯度(残余误差)的步骤。 XGBoost、LightGBM 和 CatBoost 等库添加了正则化、巧妙的分割和速度技巧。在结构化/表格数据(欺诈检测、定价、排名)方面,这些方法通常击败深度学习并赢得大多数 Kaggle 竞赛。

技术洞察

在梯度增强中,您从粗略的预测开始,并重复向残差添加一个小树拟合——损失相对于当前预测的梯度。每棵树的贡献都按学习率(收缩)进行缩放,因此模型会小步改进。由于如果过度拟合,错误会加剧,因此正则化(树深度限制、子采样行和特征、叶权重的 L1/L2 惩罚)对于防止集成记住噪声至关重要。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

集成方法和梯度提升的未来

梯度增强树仍然是表格数据的默认设置,并且没有显示出被废黜的迹象,即使深度学习在其他地方取得了进展。预计速度和 GPU 加速将持续提升,对分类数据和缺失数据进行更好的本机处理,并与自动化机器学习 (AutoML) 管道进行更紧密的集成。将 boosting 与神经网络相结合以及更快、更容易解释的变体的研究正在进行中。对于从业者来说,提升库将仍然是解决电子表格问题的可靠、高精度的首选。

现实世界的实施

银行和支付处理商使用 XGBoost 根据金额、位置和时间等表格特征来标记欺诈交易。

搜索引擎和在线商店使用梯度提升的“学习排名”模型对结果进行排名。

保险和贷款公司根据结构化客户数据预测风险并设定价格。

Kaggle 参赛者通过将 LightGBM 和 CatBoost 模型堆叠在一起赢得了表格数据竞赛。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录集成方法和梯度提升在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Ensemble Methods and Gradient Boosting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

带动量的随机梯度下降

常见问题

What is Ensemble Methods and Gradient Boosting?

集成方法结合了许多简单的模型,因此该组可以比任何单个模型做出更好的预测。梯度提升是其中最强大的——它一次构建一棵树,每棵树都会纠正上一棵树的错误,并主导现实世界的表格机器学习。

集成方法背后的核心思想是什么?

集成集合了多个模型的预测,因此它们的组合输出比单个成员更准确、更稳健。

梯度提升与装袋(例如随机森林)有何不同?

Bagging 并行构建独立模型并对它们进行平均(减少方差),而 boosting 则一个接一个地构建模型,每个模型都修复最后一个的错误(减少偏差)。

在梯度提升中,每棵新树都适合近似什么?

每棵树都适合损失的负梯度(本质上是剩余错误),因此添加它可以将预测推向正确的值。

boosting中学习率(收缩)的目的是什么?

较小的学习率会缩小每棵树的更新量,从而提高泛化能力,但代价是需要更多的树。

梯度提升树在哪种类型的数据上尤其占主导地位?

像 XGBoost 和 LightGBM 这样的库在表格数据上始终表现出色,并赢得了大多数 Kaggle 表格竞赛。