Kaggle은 데이터 과학 경진대회 플랫폼이자 데이터 과학자와 머신러닝 실무자들을 위한 온라인 커뮤니티로, Google LLC 산하에서 운영되고 있다. 사용자는 데이터셋을 찾고 게시하며, 웹 기반 데이터 과학 환경에서 모델을 탐색하고 구축하고, 다른 데이터 과학자 및 머신러닝 엔지니어와 협력하며, 데이터 과학 과제를 해결하기 위한 경진대회에 참여할 수 있다. 이 플랫폼은 또한 의학 연구에서 신뢰할 수 없는 데이터 사용과 관련된 논란에 연루된 적이 있다.
역사
Kaggle은 2010년 4월 Anthony Goldbloom에 의해 설립되었다. Kaggle 초기 사용자 중 한 명인 Jeremy Howard는 2010년 11월에 합류하여 사장 겸 최고 과학자로 재직했다. Nicholas Gruen은 초대 의장을 맡았다. 2011년에 회사는 1,250만 달러를 모금했으며, Max Levchin이 회장이 되었다. 2017년 3월 8일, Google의 최고 과학자 Fei-Fei Li는 Google이 Kaggle을 인수한다고 발표했다. 2017년 6월, Kaggle은 100만 명의 사용자를 돌파했으며, 2023년 10월 기준으로 195개국에서 1,500만 명 이상의 사용자를 보유하고 있다. 2022년, 설립자 Goldbloom과 Hamner는 물러났고 D. Sculley가 CEO가 되었다. 2023년 2월, Kaggle은 플랫폼의 다른 부분과의 긴밀한 통합을 통해 사전 훈련된 모델을 발견하고 사용할 수 있게 해주는 Models를 도입했다. 2025년 4월, Kaggle은 Wikimedia 재단과 파트너십을 맺었다.
경진대회
Kaggle은 설립 이후 많은 머신러닝 경진대회를 개최해 왔다. 주목할 만한 경진대회로는 Microsoft Kinect용 제스처 인식, Manchester City를 위한 축구 AI 개발, Two Sigma Investments를 위한 거래 알고리즘 코딩, CERN에서 힉스 보손 검색 개선 등이 있다. 경진대회 주최측은 데이터와 문제 설명을 준비하며, 상금을 지급할지 또는 무료로 진행할지 선택할 수 있다. 참가자들은 다양한 기법을 실험하며 최고의 모델을 만들기 위해 경쟁한다. 작업 내용은 Kaggle Kernels를 통해 공개적으로 공유되어 더 나은 벤치마크를 달성하고 새로운 아이디어를 고무한다. 제출은 Kaggle Kernels, 수동 업로드 또는 Kaggle API를 통해 이루어질 수 있다. 대부분의 경진대회에서 제출물은 숨겨진 솔루션 파일과 비교한 예측 정확도를 기준으로 즉시 점수가 매겨지며, 실시간 리더보드에 요약된다. 마감일 이후, 주최측은 우승 항목에 대한 전 세계적, 영구적, 취소 불가능한, 로열티 없는 사용권을 대가로 상금을 지급하며, 달리 명시되지 않는 한 이 사용권은 비독점적이다.
공개 경진대회 외에도 Kaggle은 상위 참가자로 제한된 비공개 경진대회를 제공한다. 또한 데이터 과학 교사들이 학술 경진대회를 운영할 수 있는 무료 도구를 제공하며, Facebook, Winton Capital, Walmart와 같은 기업을 위한 채용 경진대회를 주최한다. 경진대회의 성공 사례로는 HIV 연구 촉진, 체스 등급 산정, 교통량 예측 등이 있다. Geoffrey Hinton과 George Dahl은 심층 신경망을 사용하여 Merck가 주최한 경진대회에서 우승했으며, Hinton의 제자였던 Vlad Mnih도 심층 신경망을 사용하여 Adzuna가 주최한 경진대회에서 우승하여 해당 기법의 채택을 확산시켰다. University of Washington의 Tianqi Chen은 Kaggle을 통해 XGBoost의 성능을 입증했으며, 이후 XGBoost는 경진대회 우승의 주요 방법으로 Random Forest를 대체했다. 여러 학술 논문이 Kaggle 경진대회의 결과를 바탕으로 발표되었으며, 실시간 리더보드는 지속적인 혁신을 장려한다. 우승 방법은 Kaggle Winner's Blog에 자주 문서화된다.
등급 시스템
Kaggle은 사용자의 기여와 성과를 인정하고 보상하기 위해 등급 시스템을 구현했다. 이 시스템은 Novice, Contributor, Expert, Master, Grandmaster의 다섯 가지 등급으로 구성된다. 각 등급은 경진대회, 데이터셋, 커널(코드 공유), 토론 등에서 특정 기준을 충족해야 달성할 수 있다. 최고 등급인 Kaggle Grandmaster는 여러 경진대회에서 최상위권에 오른 사용자에게 수여되며, 단독 팀으로서의 높은 순위도 포함된다. 2025년 4월 2일 기준으로 2,329만 개의 Kaggle 계정 중 2,973개가 Master 등급을, 612개가 Grandmaster 등급을 달성했다.
Kaggle Notebooks
Kaggle은 Kaggle Notebooks라는 무료 브라우저 기반 통합 개발 환경(IDE)을 제공하며, 데이터 과학 및 머신러닝을 위해 설계되었다. 사용자는 Python 또는 R로 코드를 작성하고 실행할 수 있으며, 데이터셋을 가져오고, 인기 있는 라이브러리를 사용하고, CPU, GPU 또는 TPU에서 직접 클라우드 환경으로 모델을 훈련할 수 있다. 이 환경은 경진대회 제출, 튜토리얼, 교육, 탐색적 데이터 분석에 자주 사용된다.
의학 연구 논란
2025년 12월, The Transmitter에 게재된 "Exclusive: Springer Nature retracts, removes nearly 40 publications that trained neural networks on 'bonkers' dataset"라는 제목의 기사는 Kaggle에 업로드된 자폐 아동 및 비자폐 아동의 얼굴 사진 데이터셋을 지적했다. 이 데이터셋에는 2,900장 이상의 이미지가 포함되어 있었으며, 아동이나 가족의 동의를 받지 않았을 가능성이 높고, 의학 연구에 사용하기 위한 윤리적 승인도 받지 않은 것으로 보인다. 이 데이터셋을 사용한 논문 중 40편 가까이가 Springer Nature에 의해 철회되거나 삭제되었으며, 최소 90편의 다른 논문이 이 데이터셋의 변형을 인용한 것으로 나타났다. 2026년 4월, Nature에 게재된 "Dozens of AI disease-prediction models were trained on dubious data"라는 제목의 기사는 출처가 불분명한 두 개의 추가 데이터셋을 지적했다. 이 데이터셋들은 125개의 임상 예측 모델을 훈련하는 데 사용되었으며, 그중 최소 두 개는 인도네시아와 스페인의 병원에서 실제로 사용된 것으로 확인되었다. 한 논문은 의료 기기 특허에서도 인용되었다. 2026년 6월 5일 기준으로 이 데이터셋을 사용한 다섯 편의 논문이 철회되었으며, 2026년 5월 현재 Scientific Reports에 게재된 한 논문이 추가 조사 중이다. Retraction Watch의 "'Comically bad' datasets used to train clinical models for stroke and diabetes"라는 기사는 뇌졸중 및 당뇨병 예측 모델을 훈련하는 데 사용된 이미지에 Sylvester Stallone(람보 역), George Clooney, Angelina Jolie, Daniel Craig와 같은 유명 배우와 어린이 사진이 포함되어 있다고 보도했다. 역 이미지 검색 결과 일부 이미지는 뇌졸중과 관련이 없고 벨 마비(Bell's palsy)와 관련된 것으로 밝혀졌다. 현재 두 데이터셋 중 하나는 Kaggle에서 더 이상 제공되지 않지만, 다른 하나는 여전히 남아 있다.
영향과 유산
Google의 Kaggle 인수는 Kaggle을 Google Cloud 및 Google DeepMind와 같은 더 넓은 생태계로 통합하며 Machine learning 및 Artificial intelligence 역량을 강화했다. Kaggle 플랫폼은 Data Augmentation 기법과 Model Pruning 관행의 중심 허브가 되었으며, 사용자들은 Residual Network (ResNet) 및 U-Net 아키텍처를 활용하고 있다. 커뮤니티는 Deep learning 및 Neural network 연구의 발전에 기여했으며, Adam (Optimizer) 및 Batch Normalization과 같은 도구를 자주 사용한다. Kaggle의 경진대회는 Generative AI 개발에도 영향을 미쳤으며, 참가자들은 Transformer (architecture) 모델과 Large language model 애플리케이션을 탐구하고 있다. 플랫폼의 등급 시스템과 노트북은 데이터 과학 교육 및 전문성 개발의 핵심 자원이 되었으며, 전 세계의 실무자와 연구자로 구성된 글로벌 커뮤니티를 조성했다.