LightGBM, abreviatura de Light Gradient-Boosting Machine, es un framework de gradient boosting distribuido, gratuito y de código abierto, desarrollado originalmente por Microsoft. Se basa en algoritmos de árboles de decisión y se utiliza para tareas de ranking, clasificación y otros problemas de aprendizaje automático. El framework está diseñado para ofrecer alto rendimiento y escalabilidad, lo que lo convierte en una opción popular tanto en la investigación académica como en aplicaciones industriales.
LightGBM admite una variedad de algoritmos, incluidos Gradient Boosting Tree (GBT), Gradient Boosting Decision Tree (GBDT), Gradient Boosting Regression Tree (GBRT), Gradient Boosting Machine (GBM), Multiple Additive Regression Trees (MART) y Random Forest (RF). Incorpora muchas ventajas de XGBoost, como optimización dispersa, entrenamiento paralelo, múltiples funciones de pérdida, regularización, bagging y early stopping. Sin embargo, una diferencia clave radica en la construcción de los árboles: LightGBM crece los árboles de forma leaf-wise (por hoja) en lugar de level-wise (por nivel), seleccionando la hoja con la mayor pérdida delta para expandir. Este enfoque puede lograr una convergencia más rápida, pero requiere un ajuste cuidadoso para evitar el sobreajuste.
Otra característica distintiva es su uso de un algoritmo de aprendizaje basado en histogramas altamente optimizado, en lugar del enfoque basado en ordenamiento utilizado por XGBoost y otras implementaciones. Este método basado en histogramas mejora significativamente tanto la eficiencia del entrenamiento como el consumo de memoria. Además, LightGBM introduce dos técnicas novedosas: Gradient-Based One-Side Sampling (GOSS) y Exclusive Feature Bundling (EFB), que en conjunto permiten un entrenamiento más rápido sin sacrificar la precisión.
LightGBM se ejecuta en Linux, Windows y macOS, y proporciona interfaces para C++, Python, R y C#. El código fuente está licenciado bajo la Licencia MIT y está disponible en GitHub.
Gradient-Based One-Side Sampling
Gradient-Based One-Side Sampling (GOSS) es una técnica desarrollada específicamente para árboles de decisión con gradient boosting. En el gradient boosting tradicional, el modelo se conceptualiza como un valle, donde el punto más bajo representa el mejor ajuste a los datos. El algoritmo ajusta iterativamente los parámetros del modelo moviéndose en direcciones que reducen la pérdida, descendiendo efectivamente por el valle. Normalmente, este proceso utiliza todo el conjunto de datos para calcular los gradientes, asumiendo que cada punto de datos contribuye por igual a la señal de aprendizaje.
GOSS cuestiona esta suposición al reconocer que los puntos de datos con gradientes más pequeños (es decir, pendientes más suaves) son menos informativos para el proceso de aprendizaje. Estos puntos suelen corresponder a instancias bien predichas o ruido. GOSS descarta aleatoriamente una parte de estas muestras de gradiente bajo, mientras conserva todas las muestras con gradientes grandes. Este muestreo selectivo reduce el tamaño efectivo del conjunto de datos, acelerando el entrenamiento sin comprometer significativamente la precisión. Al centrarse en los puntos de datos más informativos, GOSS ayuda al modelo a capturar mejor las relaciones subyacentes en los datos, al tiempo que reduce la influencia del ruido.
Exclusive Feature Bundling
Exclusive Feature Bundling (EFB) es un método casi sin pérdidas para reducir el número de características efectivas en un conjunto de datos. En muchas aplicaciones del mundo real, especialmente aquellas con espacios de características dispersos, muchas características son casi exclusivas, lo que significa que rara vez toman valores distintos de cero simultáneamente. Las características codificadas one-hot son un ejemplo perfecto: cada categoría está representada por una característica binaria y, para una muestra dada, solo una de esas características está activa. EFB agrupa estas características exclusivas en una única característica compuesta, reduciendo así la dimensionalidad de los datos. Esta reducción conlleva un menor uso de memoria y un entrenamiento más rápido, manteniendo al mismo tiempo un alto nivel de precisión, ya que la información original se preserva mediante el proceso de agrupación. El resultado de agrupar características exclusivas en una sola se denomina paquete de características exclusivas.
Rendimiento y escalabilidad
LightGBM está diseñado para manejar conjuntos de datos a gran escala con millones de instancias y características. Su algoritmo basado en histogramas reduce el costo computacional de encontrar los puntos de división óptimos, y su estrategia de crecimiento leaf-wise puede generar árboles más profundos que capturan patrones complejos. El framework admite entrenamiento distribuido, lo que le permite escalar a través de múltiples máquinas. Esta escalabilidad hace que LightGBM sea adecuado para aplicaciones como la predicción de tasas de clics, ranking y otras tareas donde el volumen de datos es grande.
Uso y ecosistema
LightGBM se integra sin problemas con bibliotecas y plataformas populares de aprendizaje automático. Se utiliza ampliamente junto con scikit-learn y es un componente central de muchas soluciones de gradient boosting. La interfaz de Python es particularmente popular y ofrece una API familiar para los científicos de datos. LightGBM también proporciona soporte nativo para características categóricas, lo que simplifica el preprocesamiento. Su compatibilidad con C++, R y C# extiende su alcance a diversos entornos de desarrollo.
Comparación con otros frameworks
LightGBM se compara a menudo con XGBoost y CatBoost, otros dos frameworks prominentes de gradient boosting. Mientras que XGBoost utiliza crecimiento de árboles level-wise y división basada en ordenamiento, el enfoque leaf-wise y basado en histogramas de LightGBM suele resultar en tiempos de entrenamiento más rápidos y un menor uso de memoria. Sin embargo, el crecimiento leaf-wise puede llevar al sobreajuste si no se regulariza adecuadamente. CatBoost, por otro lado, destaca en el manejo de características categóricas y a menudo logra alta precisión con parámetros predeterminados. La elección entre estos frameworks depende del conjunto de datos específico y los requisitos; LightGBM suele preferirse por su velocidad y eficiencia en conjuntos de datos grandes y dispersos.
Aplicaciones
LightGBM se ha aplicado en numerosos dominios, incluidos el ranking en motores de búsqueda, sistemas de recomendación, detección de fraude y diagnósticos médicos. Su capacidad para manejar datos dispersos de alta dimensionalidad lo hace particularmente efectivo para la predicción de tasas de clics en publicidad en línea. Además, LightGBM se utiliza en competiciones en plataformas como Kaggle, donde su rendimiento y velocidad lo han convertido en un favorito entre los practicantes.
Desarrollo y comunidad
LightGBM fue presentado por primera vez en 2017 por un equipo de Microsoft Research, liderado por Guolin Ke y otros. El proyecto se mantiene activamente en GitHub, con contribuciones de una comunidad global de desarrolladores. La documentación del framework es completa y su naturaleza de código abierto fomenta la mejora continua. LightGBM ha sido citado en numerosos artículos académicos y es una herramienta estándar en el kit de herramientas de los profesionales del aprendizaje automático.
Véase también
- Machine learning
- Artificial intelligence
- Deep learning
- Neural network
- Large language model
- Transformer (architecture)
- OpenAI
- Anthropic
- Google DeepMind
- Generative AI
- AMD
- Apple
- Samsung Electronics
- Intel
- TSMC
- Broadcom
- Qualcomm
- Arm Holdings
- Amazon Web Services
- AWS Trainium
- Microsoft Azure
- Google Cloud
- Oracle Cloud Infrastructure
- Coreweave
- Cerebras
- Groq
- SambaNova
- Graphcore
- Nokia Bell Labs
- OpenPanel
- Bhabha Atomic Research Centre
- Samsung Research
- Xerox PARC
- MIT CSAIL
- Stanford AI Lab
- University of Toronto
- Carnegie Mellon University
- BAIR (Berkeley AI Research)
- University of Oxford
- Chess computer
- Sony AI
- Fujitsu
- NEC
- D-Wave
- Alibaba DAMO Academy
- Alibaba Cloud
- Amazon AI
- Halcyon AI
- Insta AI
- Omniscient
- Commure
- Intuitive Surgical
- TomTom
- BigBear.ai
- AI21 Labs
- Inflection AI
- Essential AI
- Sanctuary AI
- Figure AI
- Fermata
- Neuralink
- Braina
- Cortica
- XyloCyber
- Cruise
- Waymo
- Tesla
- Llion Jones
- Jakob Uszkoreit
- Lukasz Kaiser
- Niki Parmar
- Barret Zoph
- Mark Chen
- Brad Lightcap
- Jacob Steinhardt
- David Kaplan
- ryan lowe
- Jack Clark
- Shan Carter
- David Luan
- Chen Wu
- Ashish Kumar
- Freddie Sulit
- Karen Simonyan
- Koray Kavukcuoglu
- Thomas G. Dietterich
- Michael I. Jordan
- Daphne Koller
- Anima Anandkumar
- Samy Bengio
- Joshua Tenenbaum
- Brendan Lake
- Melanie Mitchell
- Aaron Courville
- Alan Perlis
- Aleksander Madry
- Alexei Efros
- Ali Rahimi
- Andrew Lloyd Brown
- Ani Bhattacharya
- Anna Patterson
- Anna Ritter
- Anubhav Sinha
- Arakawa Ryota
- Arka Dutta
- arthur franz
- Ben Goertzel
- Bernard Widrow
- brian cheung
- Brian Christian
- Brian Lilly White
- Rafael Calvo
- Carlos Guestrin
- Catherine Flick
- chad mirkin
- chin yen chiu
- Chris Bishop
- Christopher Bishop
- Craig Boutilier
- craig ku
- Daphna Shron
- Daphne Leon
- David Ha
- david froitzheim
- David Martin
- David Winger
- Deepak Kumar
- drew puckett
- Elaine Rich
- Eilon Reshef