Kaggle es una plataforma de competiciones de ciencia de datos y una comunidad en línea para científicos de datos y profesionales del aprendizaje automático bajo Google LLC. Permite a los usuarios encontrar y publicar conjuntos de datos, explorar y construir modelos en un entorno de ciencia de datos basado en la web, colaborar con otros científicos de datos e ingenieros de aprendizaje automático, y participar en competiciones para resolver desafíos de ciencia de datos. La plataforma se ha convertido en un centro central para la investigación en inteligencia artificial y el desarrollo práctico de modelos.
Historia
Kaggle fue fundada por Anthony Goldbloom en abril de 2010. Jeremy Howard, uno de los primeros usuarios de Kaggle, se unió en noviembre de 2010 y ocupó los cargos de Presidente y Científico Jefe. Nicholas Gruen fue el presidente fundador. En 2011, la empresa recaudó 12,5 millones de dólares, y Max Levchin se convirtió en presidente. El 8 de marzo de 2017, Fei-Fei Li, Científica Jefe de Google, anunció que Google estaba adquiriendo Kaggle.
En junio de 2017, Kaggle superó el millón de usuarios registrados. En octubre de 2023, contaba con más de 15 millones de usuarios en 194 países. En 2022, los fundadores Goldbloom y Ben Hamner renunciaron a sus cargos, y D. Sculley se convirtió en CEO. En febrero de 2023, Kaggle introdujo Modelos, permitiendo a los usuarios descubrir y usar modelos preentrenados con integraciones profundas en el resto de la plataforma. En abril de 2025, Kaggle se asoció con la Fundación Wikimedia.
Competiciones
Desde su fundación, se han llevado a cabo muchas competiciones de aprendizaje automático en Kaggle. Entre las competiciones notables se incluyen el reconocimiento de gestos para Microsoft Kinect, la creación de una IA de fútbol de asociación para Manchester City, la codificación de un algoritmo de trading para Two Sigma Investments y la mejora de la búsqueda del bosón de Higgs en el CERN.
El anfitrión de la competición prepara los datos y una descripción del problema, y puede elegir si ofrecer un premio monetario o ejecutarla sin pago. Los participantes experimentan con diferentes técnicas y compiten para producir los mejores modelos. El trabajo se comparte públicamente a través de Kaggle Kernels para lograr mejores puntos de referencia e inspirar nuevas ideas. Las presentaciones se pueden realizar mediante Kaggle Kernels, carga manual o la API de Kaggle. Para la mayoría de las competiciones, las presentaciones se puntúan inmediatamente según la precisión predictiva en relación con un archivo de solución oculto, y los resultados se resumen en una tabla de clasificación en vivo. Después de la fecha límite, el anfitrión paga el premio a cambio de una licencia mundial, perpetua, irrevocable y libre de regalías para usar la entrada ganadora, que es no exclusiva a menos que se especifique lo contrario.
Además de las competiciones públicas, Kaggle ofrece competiciones privadas limitadas a los mejores participantes. También proporciona una herramienta gratuita para que los profesores de ciencia de datos ejecuten competiciones académicas de aprendizaje automático y organiza competiciones de reclutamiento donde los científicos de datos compiten por entrevistas en empresas como Facebook, Winton Capital y Walmart.
Las competiciones de Kaggle han dado lugar a proyectos exitosos en la investigación del VIH, las calificaciones de ajedrez y la predicción del tráfico. Geoffrey Hinton y George Dahl utilizaron redes neuronales profundas para ganar una competición organizada por Merck. Vlad Mnih, uno de los estudiantes de Hinton, utilizó redes neuronales profundas para ganar una competición organizada por Adzuna, y la técnica fue adoptada posteriormente por otros en la comunidad. Tianqi Chen de la Universidad de Washington utilizó Kaggle para demostrar el poder de XGBoost, que desde entonces ha reemplazado a Random Forest como método principal para ganar competiciones. Se han publicado varios artículos académicos basados en hallazgos de competiciones de Kaggle, ayudados por la tabla de clasificación en vivo que fomenta la innovación continua. Los métodos ganadores se documentan con frecuencia en el Blog del Ganador de Kaggle.
Sistema de Progresión
Kaggle ha implementado un sistema de progresión para reconocer y recompensar a los usuarios según sus contribuciones y logros. El sistema consta de cinco niveles: Novato, Colaborador, Experto, Maestro y Gran Maestro. Cada nivel se alcanza cumpliendo criterios específicos en competiciones, conjuntos de datos, kernels (uso compartido de código) y discusiones.
El nivel más alto, Gran Maestro de Kaggle, se otorga a los usuarios que han ocupado los primeros puestos en múltiples competiciones, incluida una alta clasificación en un equipo en solitario. Al 2 de abril de 2025, de 23,29 millones de cuentas de Kaggle, 2.973 habían alcanzado el estatus de Maestro de Kaggle y 612 habían alcanzado el estatus de Gran Maestro de Kaggle.
Kaggle Notebooks
Kaggle incluye un entorno de desarrollo integrado en línea gratuito basado en navegador llamado Kaggle Notebooks, diseñado para la ciencia de datos y el aprendizaje automático. Los usuarios pueden escribir y ejecutar código en Python o R, importar conjuntos de datos, usar bibliotecas populares y entrenar modelos en CPU, GPU o TPU directamente en la nube. Este entorno se utiliza a menudo para presentaciones de competiciones, tutoriales, educación y análisis exploratorio de datos.
Problemas de Investigación Médica
En diciembre de 2025, un artículo en The Transmitter informó que Springer Nature retractó y eliminó casi 40 publicaciones que entrenaron redes neuronales con un conjunto de datos 'absurdo'. El conjunto de datos, subido a Kaggle, contenía fotografías de rostros de niños autistas y no autistas, con más de 2.900 imágenes. Es poco probable que los niños o sus familias dieran su consentimiento para su uso en investigación médica, ni se obtuvo aprobación ética. Los artículos que utilizaron el conjunto de datos fueron retractados de la literatura científica, y al menos otras 90 publicaciones citan una versión del conjunto de datos.
En abril de 2026, se identificaron dos conjuntos de datos adicionales sin procedencia de datos en Kaggle y se publicaron en Nature bajo el título 'Dozens of AI disease-prediction models were trained on dubious data'. Estos conjuntos de datos se utilizaron en 125 modelos de predicción clínica, al menos dos de los cuales se han utilizado en hospitales de Indonesia y España, mientras que un artículo que utilizaba el conjunto de datos se referenció en una patente de dispositivo médico. Al 5 de junio de 2026, cinco de los artículos que utilizaban estos conjuntos de datos habían sido retractados.
En mayo de 2026, una publicación de investigación adicional que utilizaba dos conjuntos de datos de imágenes de Kaggle quedó bajo investigación en Scientific Reports. Un artículo en Retraction Watch, titulado 'Comically bad datasets used to train clinical models for stroke and diabetes', destacó que las imágenes incluían actores famosos como Sylvester Stallone como Rambo, George Clooney, Angelina Jolie y Daniel Craig, así como niños. El uso de imágenes de niños en investigación médica sin consentimiento sería poco ético. La búsqueda inversa de imágenes reveló que algunas imágenes no eran para accidentes cerebrovasculares sino para parálisis de Bell. Uno de los conjuntos de datos ya no está disponible en Kaggle, mientras que el otro permanece y menciona el problema de la procedencia de las imágenes.