LightGBM,全称为轻量级梯度提升机(Light Gradient-Boosting Machine),是一个免费且开源的分布式梯度提升框架,最初由微软开发。它基于决策树算法,用于排序、分类以及其他机器学习任务。该框架设计旨在实现高性能和可扩展性,使其在学术研究和工业应用中均广受欢迎。
LightGBM支持多种算法,包括梯度提升树(GBT)、梯度提升决策树(GBDT)、梯度提升回归树(GBRT)、梯度提升机(GBM)、多重加性回归树(MART)以及随机森林(RF)。它融合了XGBoost的诸多优势,例如稀疏优化、并行训练、多种损失函数、正则化、袋装法(bagging)以及早停法(early stopping)。然而,两者在树构建方式上存在关键差异:LightGBM采用叶子生长(leaf-wise)策略,而非层级生长(level-wise)策略,即每次选择损失增量最大的叶子节点进行分裂。这种方法可以加快收敛速度,但需要仔细调整参数以避免过拟合。
另一个显著特点是其使用了高度优化的基于直方图的决策树学习算法,而非XGBoost及其他实现所采用的基于排序的方法。这种直方图方法显著提升了训练效率并降低了内存消耗。此外,LightGBM还引入了两种新颖技术:基于梯度的单边采样(GOSS)和互斥特征捆绑(EFB),二者共同实现了更快的训练速度,同时保持了较高的准确率。
LightGBM可运行于Linux、Windows和macOS操作系统,并提供C++、Python、R和C#的接口。其源代码以MIT许可证发布,并可在GitHub上获取。
基于梯度的单边采样
基于梯度的单边采样(GOSS)是一种专门为梯度提升决策树开发的技术。在传统梯度下降中,模型被视作一个山谷,最低点代表对数据的最佳拟合。算法通过沿减少损失的方向迭代调整模型参数,从而有效地下沉至谷底。通常,这一过程会使用整个数据集来计算梯度,并假设每个数据点对学习信号的贡献相等。
GOSS对这一假设提出了挑战,它认识到梯度较小(即坡度较缓)的数据点在训练过程中信息量较低。这些点通常对应已被良好预测的样本或噪声。GOSS会随机丢弃一部分这类低梯度样本,同时保留所有高梯度样本。这种选择性采样减少了有效数据集的大小,从而加快了训练速度,且不会显著损害准确率。通过聚焦于信息量最大的数据点,GOSS帮助模型更好地捕捉数据中的潜在关系,同时降低了噪声的影响。
互斥特征捆绑
互斥特征捆绑(EFB)是一种近无损的方法,用于减少数据集中的有效特征数量。在许多实际应用中,尤其是特征空间稀疏的场景下,许多特征具有近似互斥性,即它们很少同时取非零值。独热编码(one-hot encoding)特征就是一个典型例子:每个类别由一个二元特征表示,对于任意给定样本,仅有一个特征处于激活状态。EFB将这些互斥特征捆绑成一个复合特征,从而降低了数据的维度。这种降维减少了内存占用并加快了训练速度,同时由于捆绑过程保留了原始信息,因此仍能维持较高的准确率。
性能与可扩展性
LightGBM专为处理包含数百万实例和特征的大规模数据集而设计。其基于直方图的算法降低了寻找最优分裂点的计算成本,而其叶子生长策略可生成更深的树,从而捕捉复杂模式。该框架支持分布式训练,可跨多台机器进行扩展。这种可扩展性使LightGBM适用于点击率预测、排序以及其他数据量庞大的任务。
使用与生态系统
LightGBM与流行的机器学习库和平台实现了无缝集成。它常与scikit-learn配合使用,并成为众多梯度提升解决方案的核心组件。其Python接口尤其受欢迎,为数据科学家提供了熟悉的API。LightGBM还原生支持类别特征,简化了预处理流程。其对C++、R和C#的兼容性进一步扩展了其在不同开发环境中的适用范围。
与其他框架的比较
LightGBM常被拿来与XGBoost和CatBoost进行比较,后两者也是著名的梯度提升框架。XGBoost采用层级生长和基于排序的分裂查找,而LightGBM则采用叶子生长和基于直方图的方法,通常能实现更快的训练速度和更低的内存占用。然而,叶子生长策略若未适当正则化,可能导致过拟合。相比之下,CatBoost在处理类别特征方面表现出色,且常能在默认参数下达到较高准确率。选择哪个框架取决于具体的数据集和需求;在处理大规模稀疏数据时,LightGBM因其速度和效率而常被优先选用。
应用领域
LightGBM已广泛应用于众多领域,包括搜索排序、推荐系统、欺诈检测和医疗诊断。其处理高维稀疏数据的能力使其在在线广告的点击率预测中尤为有效。此外,LightGBM在Kaggle等竞赛平台上广受欢迎,其性能和速度使其成为参赛者的常用工具。
开发与社区
LightGBM于2017年由微软研究院的顾凯(Guolin Ke)等人首次推出。该项目在GitHub上持续维护,并得到了全球开发者社区的贡献。其文档内容全面,开源特性鼓励了持续的改进。LightGBM已被大量学术论文引用,并成为机器学习从业者工具箱中的标准工具。
参见
- 机器学习
- 人工智能
- 深度学习
- 神经网络
- 大语言模型
- Transformer
- OpenAI
- Anthropic
- Google DeepMind
- 生成式AI
- AMD
- 苹果
- 三星电子
- 英特尔
- 台积电
- 博通
- 高通
- ARM控股
- 亚马逊云服务
- AWS Trainium
- Azure
- 谷歌云
- 甲骨文云
- CoreWeave
- Cerebras
- Groq
- SambaNova
- Graphcore
- 诺基亚贝尔实验室
- Open Panel
- 巴巴原子研究中心
- 三星研究院
- 施乐帕洛阿尔托研究中心
- 麻省理工学院计算机科学与人工智能实验室
- 斯坦福人工智能实验室
- 多伦多大学
- 卡内基梅隆大学
- 伯克利人工智能研究
- 牛津大学
- 国际象棋计算机
- 索尼AI
- 富士通
- NEC
- D-Wave
- 阿里巴巴达摩院
- 阿里云
- 亚马逊
- Halcyon
- Insta Academy
- Omniscient
- Commure
- 直觉外科
- TomTom
- BigBear.ai
- AI21 Labs
- Inflection AI
- Essential AI
- Sanctuary AI
- Figure AI
- Fermata
- Neuralink
- Braina
- Cortica
- Xyber
- Cruise
- Waymo
- 特斯拉自动驾驶
- Llion Jones
- Jakob Uszkoreit
- Lukasz Kaiser
- Niki Parmar
- Barret Zoph
- Mark Chen
- Brad Lightcap
- Jacob Steinhardt
- David Kaplan
- Ryan Lowe
- Jack Clark
- Shan Carter
- David Luan
- Chen Wu
- Ashish Kumar
- Freddie Sulit
- Karen Simonyan
- Koray Kavukcuoglu
- Thomas Dietterich
- Michael Jordan
- Daphne Koller
- Anima Anandkumar
- Samy Bengio
- Joshua Tenenbaum
- Brendan Lake
- Melanie Mitchell
- Aaron Courville
- Alan Perlis
- Aleksander Madry
- Alexei Efros
- Ali Rahimi
- Andrew Lloyd Brown
- Ani Bhattacharya
- Anna Patterson
- Anna Ritter
- Anubhav Sinha
- Arakawa Ryota
- Arka Dutta
- Arthur Franz
- Ben Goertzel
- Bernard Widrow
- Brian Cheung
- Brian Christian
- Brian Lilly White
- Calvo Rafael
- Carlos Guestrin
- Catherine Flick
- Chad Mirkin
- Chin-Yen Chiu
- Chris Bishop
- Christopher Bishop
- Craig Boutilier
- Craig Ku
- Dafna Sharon
- Daphne Leon
- David Ha
- David Froitzheim
- David Martin
- David Winger
- Deepak Kumar
- Drew Puckett
- Elaine Rich
- Eilon Reshef