Kaggle es una plataforma de competiciones de ciencia de datos y una comunidad en línea para científicos de datos y profesionales del aprendizaje automático, que opera bajo Google LLC. Permite a los usuarios encontrar y publicar conjuntos de datos, explorar y construir modelos en un entorno de ciencia de datos basado en la web, colaborar con otros científicos de datos e ingenieros de aprendizaje automático, y participar en competiciones para resolver desafíos de ciencia de datos. La plataforma también ha estado involucrada en controversias relacionadas con el uso de datos poco éticos y poco fiables en la investigación médica.
Historia
Kaggle fue fundada por Anthony Goldbloom en abril de 2010. Jeremy Howard, uno de los primeros usuarios de Kaggle, se unió en noviembre de 2010 y ocupó los cargos de Presidente y Científico Jefe. Nicholas Gruen fue el presidente fundador. En 2011, la empresa recaudó 12,5 millones de dólares, y Max Levchin se convirtió en presidente del consejo. El 8 de marzo de 2017, Fei-Fei Li, Científica Jefe de Google, anunció que Google adquiría Kaggle. En junio de 2017, Kaggle superó el millón de usuarios registrados, y en octubre de 2023, cuenta con más de 15 millones de usuarios en 194 países. En 2022, los fundadores Goldbloom y Hamner renunciaron, y D. Sculley se convirtió en CEO. En febrero de 2023, Kaggle introdujo Modelos, permitiendo a los usuarios descubrir y usar modelos preentrenados mediante integraciones profundas con el resto de la plataforma. En abril de 2025, Kaggle se asoció con la Fundación Wikimedia.
Competiciones
Desde su fundación, se han realizado muchas competiciones de aprendizaje automático en Kaggle. Entre las competiciones notables se incluyen el reconocimiento de gestos para Microsoft Kinect, la creación de una IA de fútbol asociación para Manchester City, la codificación de un algoritmo de trading para Two Sigma Investments y la mejora de la búsqueda del bosón de Higgs en el CERN. El anfitrión de la competición prepara los datos y una descripción del problema, y puede elegir si recompensar con dinero o dejarla sin pago. Los participantes experimentan con diferentes técnicas y compiten para producir los mejores modelos. El trabajo se comparte públicamente a través de Kaggle Kernels para lograr mejores puntos de referencia e inspirar nuevas ideas. Las presentaciones se pueden realizar a través de Kaggle Kernels, carga manual o la API de Kaggle. En la mayoría de las competiciones, las presentaciones se puntúan inmediatamente según la precisión predictiva en relación con un archivo de solución oculto y se resumen en una tabla de clasificación en vivo. Después de la fecha límite, el anfitrión paga el premio en metálico a cambio de una licencia mundial, perpetua, irrevocable y libre de regalías para usar la entrada ganadora, que es no exclusiva a menos que se especifique lo contrario.
Además de las competiciones públicas, Kaggle ofrece competiciones privadas limitadas a los mejores participantes. También proporciona una herramienta gratuita para que los profesores de ciencia de datos realicen competiciones académicas y organiza competiciones de reclutamiento para empresas como Facebook, Winton Capital y Walmart. Los proyectos exitosos de las competiciones incluyen el avance de la investigación sobre el VIH, las calificaciones de ajedrez y la predicción del tráfico. Geoffrey Hinton y George Dahl utilizaron redes neuronales profundas para ganar una competición organizada por Merck, y Vlad Mnih, un estudiante de Hinton, usó redes neuronales profundas para ganar una competición organizada por Adzuna, lo que llevó a una adopción más amplia de la técnica. Tianqi Chen, de la Universidad de Washington, utilizó Kaggle para demostrar el poder de XGBoost, que desde entonces ha reemplazado a Random Forest como método principal para ganar competiciones. Se han publicado varios artículos académicos basados en hallazgos de competiciones de Kaggle, y la tabla de clasificación en vivo fomenta la innovación continua. Los métodos ganadores se documentan con frecuencia en el Blog del Ganador de Kaggle.
Sistema de Progresión
Kaggle ha implementado un sistema de progresión para reconocer y recompensar a los usuarios según sus contribuciones y logros. El sistema consta de cinco niveles: Novato, Colaborador, Experto, Maestro y Gran Maestro. Cada nivel se alcanza cumpliendo criterios específicos en competiciones, conjuntos de datos, kernels (compartición de código) y discusiones. El nivel más alto, Gran Maestro de Kaggle, se otorga a usuarios que han ocupado los primeros puestos en múltiples competiciones, incluida una alta clasificación en un equipo en solitario. A partir del 2 de abril de 2025, de los 23,29 millones de cuentas de Kaggle, 2.973 han alcanzado el estatus de Maestro y 612 han alcanzado el estatus de Gran Maestro.
Kaggle Notebooks
Kaggle incluye un entorno de desarrollo integrado en línea gratuito basado en navegador llamado Kaggle Notebooks, diseñado para la ciencia de datos y el aprendizaje automático. Los usuarios pueden escribir y ejecutar código en Python o R, importar conjuntos de datos, usar bibliotecas populares y entrenar modelos en CPU, GPU o TPU directamente en la nube. Este entorno se utiliza a menudo para presentaciones de competiciones, tutoriales, educación y análisis exploratorio de datos.
Problemas de Investigación Médica
En diciembre de 2025, un artículo en The Transmitter titulado "Exclusiva: Springer Nature retracta y elimina casi 40 publicaciones que entrenaron redes neuronales con un conjunto de datos 'descabellado'" destacó un conjunto de datos subido a Kaggle que contenía fotografías de rostros de niños autistas y no autistas. El conjunto de datos contenía más de 2.900 imágenes, y es poco probable que los niños o sus familias dieran su consentimiento para su uso en investigación médica o que las imágenes fueran aprobadas éticamente. Los artículos que usaban el conjunto de datos en Springer Nature fueron retractados, y al menos otras 90 publicaciones citan una versión del conjunto de datos. En abril de 2026, se identificaron dos conjuntos de datos adicionales sin procedencia de datos en Kaggle, como se publicó en Nature titulado "Docenas de modelos de predicción de enfermedades con IA fueron entrenados con datos dudosos". Estos conjuntos de datos se usaron en 125 modelos de predicción clínica, al menos dos de los cuales se han utilizado en hospitales de Indonesia y España, mientras que un artículo fue referenciado en una patente de dispositivo médico. A partir del 5 de junio de 2026, cinco artículos que usan estos conjuntos de datos han sido retractados. En mayo de 2026, una publicación de investigación adicional que usa dos conjuntos de datos de imágenes de Kaggle está bajo investigación en Scientific Reports. Un artículo en Retraction Watch titulado "Conjuntos de datos 'cómicamente malos' usados para entrenar modelos clínicos para accidentes cerebrovasculares y diabetes" señaló que las imágenes incluían actores famosos como Sylvester Stallone como Rambo, George Clooney, Angelina Jolie y Daniel Craig, así como niños. La búsqueda inversa de imágenes reveló que algunas imágenes no eran para accidentes cerebrovasculares sino para parálisis de Bell. Un conjunto de datos ya no está disponible en Kaggle, mientras que el otro permanece.
Impacto y Legado
La adquisición por parte de Google integró Kaggle en el ecosistema más amplio de Google Cloud y Google DeepMind, mejorando sus capacidades en Machine learning y Artificial intelligence. La plataforma de Kaggle se ha convertido en un centro central para técnicas de Data Augmentation y prácticas de Model Pruning, con usuarios que aprovechan arquitecturas de Residual Network (ResNet) y U-Net. La comunidad ha contribuido a avances en la investigación de Deep learning y Neural network, a menudo usando herramientas como Adam (Optimizer) y Batch Normalization. Las competiciones de Kaggle también han influido en el desarrollo de Generative AI, con participantes que exploran modelos Transformer (architecture) y aplicaciones de Large language model. El sistema de progresión y los notebooks de la plataforma la han convertido en un recurso clave para la educación y el desarrollo profesional en ciencia de datos, fomentando una comunidad global de profesionales e investigadores.