Kaggle是一个数据科学竞赛平台,也是面向数据科学家和机器学习从业者的在线社区,隶属于Google LLC旗下。它使用户能够查找和发布数据集,在基于网页的数据科学环境中探索和构建模型,与其他数据科学家和机器学习工程师协作,并参与竞赛以解决数据科学挑战。该平台也曾因在医学研究中使用不道德且不可靠的数据而引发争议。
历史
Kaggle由Anthony Goldbloom于2010年4月创立。Jeremy Howard是最早的Kaggle用户之一,于2010年11月加入,并担任总裁兼首席科学家。Nicholas Gruen是创始主席。2011年,公司筹集了1250万美元,Max Levchin成为董事长。2017年3月8日,Google首席科学家李飞飞宣布Google将收购Kaggle。2017年6月,Kaggle注册用户突破100万,截至2023年10月,其在194个国家拥有超过1500万用户。2022年,创始人Goldbloom和Hamner卸任,D. Sculley成为首席执行官。2023年2月,Kaggle推出了Models功能,允许用户通过与平台其他部分的深度集成来发现和使用预训练模型。2025年4月,Kaggle与维基媒体基金会合作。
竞赛
自成立以来,Kaggle上已举办了许多机器学习竞赛。著名的竞赛包括为Microsoft Kinect进行手势识别、为曼城打造足球人工智能、为Two Sigma Investments编写交易算法,以及改进CERN对希格斯玻色子的搜索。竞赛主办方准备数据和问题描述,并可以选择是否提供金钱奖励或保持无偿。参与者尝试不同的技术,竞争以产生最佳模型。工作通过Kaggle Kernels公开共享,以实现更好的基准并激发新想法。提交可以通过Kaggle Kernels、手动上传或Kaggle API进行。对于大多数竞赛,提交会根据相对于隐藏解决方案文件的预测准确性立即评分,并在实时排行榜上汇总。截止日期后,主办方支付奖金,以换取对获胜作品的全世界的、永久的、不可撤销的且免版税的使用许可,除非另有规定,否则该许可是非排他性的。
除了公开竞赛外,Kaggle还提供仅限于顶级参与者参加的私人竞赛。它还提供免费工具供数据科学教师举办学术竞赛,并为Facebook、Winton Capital和Walmart等公司举办招聘竞赛。竞赛中的成功项目包括推进HIV研究、国际象棋评级和交通预测。Geoffrey Hinton和George Dahl使用深度神经网络赢得了由Merck主办的竞赛,而Hinton的学生Vlad Mnih使用深度神经网络赢得了由Adzuna主办的竞赛,这推动了该技术的更广泛采用。华盛顿大学的Tianqi Chen利用Kaggle展示了XGBoost的强大功能,此后XGBoost已取代随机森林成为赢得竞赛的主要方法。基于Kaggle竞赛的发现已发表了多篇学术论文,实时排行榜鼓励持续创新。获胜方法经常记录在Kaggle获胜者博客上。
进阶系统
Kaggle实施了一个进阶系统,以根据贡献和成就来认可和奖励用户。该系统由五个等级组成:新手、贡献者、专家、大师和特级大师。每个等级通过满足竞赛、数据集、内核(代码共享)和讨论中的特定标准来实现。最高等级Kaggle特级大师授予在多个竞赛中排名靠前(包括在单人团队中排名靠前)的用户。截至2025年4月2日,在2329万个Kaggle账户中,有2973人达到了大师级别,612人达到了特级大师级别。
Kaggle Notebooks
Kaggle包含一个免费的、基于浏览器的在线集成开发环境,称为Kaggle Notebooks,专为数据科学和机器学习而设计。用户可以用Python或R编写和执行代码,导入数据集,使用流行的库,并直接在云端在CPU、GPU或TPU上训练模型。该环境通常用于竞赛提交、教程、教育和探索性数据分析。
医学研究问题
2025年12月,The Transmitter上一篇题为“独家:Springer Nature撤回并删除了近40篇使用‘荒谬’数据集训练神经网络的出版物”的文章,强调了上传到Kaggle的一个数据集,其中包含自闭症和非自闭症儿童面孔的照片。该数据集包含超过2900张图像,儿童或其家人不太可能同意将其用于医学研究,或者这些图像未经伦理批准。使用该数据集在Springer Nature上发表的文章被撤回,至少90篇其他出版物引用了该数据集的一个版本。2026年4月,在Kaggle上发现了另外两个没有数据来源的数据集,如Nature上发表的题为“数十个AI疾病预测模型基于可疑数据进行训练”的文章所述。这些数据集被用于125个临床预测模型,其中至少两个已在印度尼西亚和西班牙的医院中使用,而一篇文章被引用在一项医疗器械专利中。截至2026年6月5日,使用这些数据集的五篇文章已被撤回。2026年5月,一篇使用Kaggle两个图像数据集的研究出版物正在Scientific Reports中接受调查。Retraction Watch上一篇题为“‘荒谬可笑’的数据集用于训练中风和糖尿病的临床模型”的文章指出,图像中包括著名演员,如史泰龙饰演的兰博、乔治·克鲁尼、安吉丽娜·朱莉和丹尼尔·克雷格,以及儿童。反向图像搜索显示,一些图像并非用于中风,而是用于贝尔氏麻痹。其中一个数据集在Kaggle上已不再可用,而另一个仍然存在。
影响与遗产
Google的收购将Kaggle整合到Google Cloud和Google DeepMind的更广泛生态系统中,增强了其在Machine learning和Artificial intelligence方面的能力。Kaggle平台已成为Data Augmentation技术和Model Pruning实践的中心枢纽,用户利用Residual Network (ResNet)和U-Net架构。该社区为Deep learning和Neural network研究的进展做出了贡献,通常使用Adam (Optimizer)和Batch Normalization等工具。Kaggle的竞赛也影响了Generative AI的发展,参与者探索了Transformer (architecture)模型和Large language model应用。该平台的进阶系统和Notebooks使其成为数据科学教育和专业发展的关键资源,培养了全球从业者和研究人员社区。