译自英文

Kaggle Competitions是一个机器学习竞赛和数据科学挑战平台,成立于2010年,并于2017年被Google收购。它举办公开和私人的竞赛,提供进阶系统,并支持基于云端的笔记本用于模型构建。

Kaggle竞赛是Kaggle的一项核心功能,Kaggle是一个数据科学竞赛平台,面向数据科学家和机器学习从业者,由Google LLC拥有。自2010年4月由Anthony Goldbloom创立以来,Kaggle使用户能够查找和发布数据集、在基于Web的环境中构建模型,并参与竞赛以解决数据科学挑战。截至2023年10月,该平台已拥有超过1500万用户,覆盖194个国家,其竞赛已成为机器学习人工智能领域创新的基准。然而,该平台也因助长在医学研究中使用不道德且不可靠的数据而受到批评。

历史

Kaggle由Anthony Goldbloom于2010年4月创立。Jeremy Howard是首批用户之一,于2010年11月加入,并担任总裁兼首席科学家,Nicholas Gruen担任创始主席。2011年,公司筹集了1250万美元,Max Levchin成为董事长。2017年3月8日,时任Google首席科学家的Fei-Fei Li宣布Google收购Kaggle。2017年6月,Kaggle注册用户突破100万,截至2023年10月,用户已超过1500万,覆盖194个国家。2022年,创始人Goldbloom和Ben Hamner卸任,D. Sculley出任首席执行官。2023年2月,Kaggle推出Models功能,允许用户发现和使用预训练模型,并支持深度集成。2025年4月,Kaggle与维基媒体基金会建立合作伙伴关系。

竞赛

自成立以来,Kaggle已举办众多机器学习竞赛。著名案例包括为Microsoft Kinect进行手势识别、为Manchester City开发足球AI、为Two Sigma Investments设计交易算法,以及改进希格斯玻色子的搜索。竞赛主办方准备数据集并提供问题描述,有时会设置奖金。参赛者通过实验各种技术来竞争生成最佳模型,并通过Kaggle Notebooks(原Kernels)公开分享工作。提交可通过Notebooks、手动上传或Kaggle API完成。大多数竞赛会立即对提交结果进行评分,并在实时排行榜上显示结果。获胜者需授予主办方全球性、永久、不可撤销且免版税的使用权,除非另有说明,否则该授权为非独占性。

Kaggle还提供仅限顶级参与者参加的私人竞赛、面向学术界的免费工具,以及数据科学家竞争面试机会的招聘竞赛。成功的项目推动了HIV研究、国际象棋评级和交通预测的进展。值得注意的是,Geoffrey Hinton和George Dahl使用深度学习神经网络赢得了Merck竞赛,而Hinton的学生Vlad Mnih则使用类似技术赢得了Adzuna竞赛,从而推广了深度学习在社区中的应用。Tianqi Chen来自华盛顿大学,他展示了XGBoost的强大性能,此后XGBoost取代随机森林成为Kaggle竞赛中的主流方法。多篇学术论文基于竞赛成果发表,这些成果常常受到实时排行榜推动创新的启发。

进阶系统

Kaggle设有进阶系统,包含五个等级:新手(Novice)、贡献者(Contributor)、专家(Expert)、大师(Master)和宗师(Grandmaster)。等级通过满足竞赛、数据集、Notebooks和讨论区中的标准来获得。最高等级Kaggle宗师要求在多项竞赛中取得顶尖排名,包括以个人身份参赛时的高排名。截至2025年4月2日,在2329万个账户中,有2973人达到大师等级,612人达到宗师等级。

Kaggle Notebooks

Kaggle Notebooks是一个免费的、基于浏览器的集成开发环境,用于数据科学和机器学习。用户可以使用Python或R语言编写和执行代码,导入数据集,使用常用库,并在云端利用CPU、GPU或TPU训练模型。它广泛用于竞赛提交、教程、教育和探索性数据分析。

医学研究问题

Kaggle因用于医学研究的数据集而受到审查。2025年12月,《The Transmitter》报道称,Springer Nature撤回了或移除了近40篇出版物,这些出版物使用了一个包含自闭症和非自闭症儿童面部照片的数据集训练神经网络,该数据集上传至Kaggle,包含超过2900张图像。这些图像的使用不太可能获得同意,至少有90篇其他出版物引用了该数据集。2026年4月,《Nature》发表文章指出,两个Kaggle数据集缺乏数据来源记录,却被用于125个临床预测模型,其中包括印度尼西亚和西班牙医院使用的两个模型,以及一个医疗器械专利中引用的模型。截至2026年6月5日,使用这些数据集的五篇文章已被撤回。2026年5月,《Retraction Watch》发表文章,批评这些数据集“荒谬可笑”,涉及中风和糖尿病数据,其中包含西尔维斯特·史泰龙和乔治·克鲁尼等名人的图像,以及儿童图像,且部分图像标签错误。其中一个数据集已从Kaggle移除,而另一个仍在平台上,且未获得儿童图像的同意。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·data-science·competitions·kaggle
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史