Kaggle是一个数据科学竞赛平台,也是供数据科学家和机器学习从业者使用的在线社区,隶属于Google LLC。它使用户能够查找和发布数据集,在基于网页的数据科学环境中探索和构建模型,与其他数据科学家和机器学习工程师协作,并参加竞赛以解决数据科学挑战。该平台已成为人工智能研究和实用模型开发的核心中心。
历史
Kaggle由Anthony Goldbloom于2010年4月创立。Jeremy Howard是Kaggle最早的用户之一,于2010年11月加入,并担任总裁兼首席科学家。Nicholas Gruen担任创始主席。2011年,公司筹集了1250万美元,Max Levchin成为董事长。2017年3月8日,Google首席科学家李飞飞宣布Google收购Kaggle。
2017年6月,Kaggle注册用户突破100万。截至2023年10月,它在194个国家拥有超过1500万用户。2022年,创始人Goldbloom和Ben Hamner卸任职务,D. Sculley成为首席执行官。2023年2月,Kaggle推出了Models功能,允许用户发现和使用预训练模型,并与平台其他部分深度集成。2025年4月,Kaggle与维基媒体基金会建立了合作伙伴关系。
竞赛
自成立以来,Kaggle上举办了许多机器学习竞赛。著名的竞赛包括为Microsoft Kinect进行手势识别、为曼彻斯特城足球俱乐部创建足球AI、为Two Sigma Investments编写交易算法,以及改进CERN对希格斯玻色子的搜索。
竞赛主办方准备数据和问题描述,并可以选择是否提供金钱奖励或无偿举办。参与者尝试不同的技术,并竞争以产生最佳模型。工作通过Kaggle Kernels公开共享,以实现更好的基准并激发新想法。提交可以通过Kaggle Kernels、手动上传或Kaggle API进行。对于大多数竞赛,提交会根据相对于隐藏解决方案文件的预测准确性立即评分,结果汇总在实时排行榜上。截止日期后,主办方支付奖金,以换取对获奖条目的全球性、永久性、不可撤销且免版税的许可,除非另有说明,该许可是非排他性的。
除了公开竞赛外,Kaggle还提供仅限于顶尖参与者的私人竞赛。它还提供免费工具,供数据科学教师举办学术机器学习竞赛,并举办招聘竞赛,数据科学家在其中竞争Facebook、Winton Capital和Walmart等公司的面试机会。
Kaggle竞赛已在HIV研究、国际象棋评级和交通预测等领域取得了成功项目。Geoffrey Hinton和George Dahl使用深度神经网络赢得了由Merck主办的竞赛。Hinton的学生Vlad Mnih使用深度神经网络赢得了由Adzuna主办的竞赛,该技术随后被社区中的其他人采用。来自华盛顿大学的Tianqi Chen利用Kaggle展示了XGBoost的强大功能,此后XGBoost已取代随机森林成为赢得竞赛的主要方法。基于Kaggle竞赛的发现,已发表了多篇学术论文,实时排行榜鼓励持续创新,对此起到了推动作用。获奖方法经常记录在Kaggle获奖者博客上。
进阶系统
Kaggle实施了一个进阶系统,根据贡献和成就来认可和奖励用户。该系统由五个等级组成:新手、贡献者、专家、大师和特级大师。每个等级通过满足竞赛、数据集、Kernels(代码共享)和讨论中的特定标准来实现。
最高等级,即Kaggle特级大师,授予在多个竞赛中排名靠前,包括在单人团队中排名靠前的用户。截至2025年4月2日,在2329万个Kaggle账户中,有2973个达到了Kaggle大师状态,612个达到了Kaggle特级大师状态。
Kaggle Notebooks
Kaggle包含一个免费的、基于浏览器的在线集成开发环境,称为Kaggle Notebooks,专为数据科学和机器学习设计。用户可以用Python或R编写和执行代码,导入数据集,使用流行的库,并直接在云端在CPU、GPU或TPU上训练模型。该环境常用于竞赛提交、教程、教育和探索性数据分析。
医学研究问题
2025年12月,《The Transmitter》上的一篇文章报道称,Springer Nature撤回了近40篇基于一个“荒谬”数据集训练神经网络的出版物。该数据集上传至Kaggle,包含自闭症和非自闭症儿童面孔的照片,超过2900张图像。这些儿童或其家人不太可能同意将其用于医学研究,也未获得伦理批准。使用该数据集的文章已从科学文献中撤回,至少还有90篇其他出版物引用了该数据集的一个版本。
2026年4月,在Kaggle上发现了另外两个没有数据来源的数据集,并以“数十个AI疾病预测模型基于可疑数据训练”为标题发表在《Nature》上。这些数据集被用于125个临床预测模型,其中至少有两个已在印度尼西亚和西班牙的医院中使用,而一篇使用该数据集的文章被引用在一项医疗设备专利中。截至2026年6月5日,使用这些数据集的五篇文章已被撤回。
2026年5月,在《Scientific Reports》中,一项使用来自Kaggle的两个图像数据集的其他研究出版物受到调查。《Retraction Watch》上一篇题为“用于训练中风和糖尿病临床模型的荒谬数据集”的文章指出,这些图像包括著名演员,如饰演Rambo的西尔维斯特·史泰龙、乔治·克鲁尼、安吉丽娜·朱莉和丹尼尔·克雷格,以及儿童。在未经同意的情况下将儿童图像用于医学研究将是不道德的。反向图像搜索显示,一些图像并非用于中风,而是用于贝尔氏 palsy。其中一个数据集已不再在Kaggle上可用,而另一个仍然存在,并提到了图像来源问题。