Kaggle은 Google LLC 산하의 데이터 과학자 및 머신러닝 실무자들을 위한 데이터 과학 경진대회 플랫폼이자 온라인 커뮤니티입니다. 이 플랫폼은 사용자가 데이터셋을 찾고 게시하며, 웹 기반 데이터 과학 환경에서 모델을 탐색하고 구축하고, 다른 데이터 과학자 및 머신러닝 엔지니어와 협업하고, 데이터 과학 과제를 해결하기 위한 경진대회에 참가할 수 있게 해줍니다. 이 플랫폼은 인공지능 연구와 실용적인 모델 개발의 중심 허브가 되었습니다.
역사
Kaggle은 2010년 4월 Anthony Goldbloom에 의해 설립되었습니다. Kaggle 최초 사용자 중 한 명인 Jeremy Howard는 2010년 11월에 합류하여 사장 겸 최고 과학자로 재직했습니다. Nicholas Gruen은 초대 의장을 역임했습니다. 2011년에 회사는 1,250만 달러를 모금했고 Max Levchin이 회장이 되었습니다. 2017년 3월 8일, Google의 최고 과학자 Fei-Fei Li는 Google이 Kaggle을 인수한다고 발표했습니다.
2017년 6월, Kaggle은 등록 사용자 100만 명을 돌파했습니다. 2023년 10월 기준으로 194개국에서 1,500만 명 이상의 사용자를 보유하고 있습니다. 2022년에 공동 창업자 Goldbloom과 Ben Hamner는 직위에서 물러났고 D. Sculley가 CEO가 되었습니다. 2023년 2월, Kaggle은 Models를 도입하여 사용자가 사전 훈련된 모델을 발견하고 플랫폼의 나머지 부분과 긴밀하게 통합하여 사용할 수 있게 했습니다. 2025년 4월, Kaggle은 Wikimedia 재단과 파트너십을 체결했습니다.
경진대회
Kaggle은 설립 이후로 많은 머신러닝 경진대회를 개최해 왔습니다. 주목할 만한 경진대회로는 Microsoft Kinect용 제스처 인식, Manchester City를 위한 축구 AI 생성, Two Sigma Investments를 위한 거래 알고리즘 코딩, CERN에서 힉스 보존 검색 개선 등이 있습니다.
경진대회 주최자는 데이터와 문제 설명을 준비하며, 상금을 제공할지 또는 무료로 운영할지 선택할 수 있습니다. 참가자들은 다양한 기법을 실험하고 최상의 모델을 만들기 위해 경쟁합니다. 작업은 더 나은 벤치마크를 달성하고 새로운 아이디어를 고취하기 위해 Kaggle Kernels를 통해 공개적으로 공유됩니다. 제출은 Kaggle Kernels, 수동 업로드 또는 Kaggle API를 통해 이루어질 수 있습니다. 대부분의 경진대회에서 제출물은 숨겨진 솔루션 파일에 대한 예측 정확도를 기준으로 즉시 점수가 매겨지며 결과는 실시간 리더보드에 요약됩니다. 마감일 이후 주최자는 우승 항목에 대한 전 세계적, 영구적, 취소 불가능한, 로열티 없는 라이선스를 받는 대가로 상금을 지불하며, 별도로 명시되지 않는 한 이는 비독점적입니다.
공개 경진대회와 함께 Kaggle은 최상위 참가자로 제한된 비공개 경진대회도 제공합니다. 또한 데이터 과학 교사가 학술 머신러닝 경진대회를 운영할 수 있는 무료 도구를 제공하며, Facebook, Winton Capital, Walmart와 같은 회사에서 데이터 과학자가 면접을 위해 경쟁하는 채용 경진대회를 주최합니다.
Kaggle 경진대회는 HIV 연구, 체스 레이팅, 교통 예측 분야에서 성공적인 프로젝트로 이어졌습니다. Geoffrey Hinton과 George Dahl은 Merck가 주최한 경진대회에서 우승하기 위해 심층 신경망을 사용했습니다. Hinton의 학생 중 한 명인 Vlad Mnih는 Adzuna가 주최한 경진대회에서 우승하기 위해 심층 신경망을 사용했으며, 이 기법은 이후 커뮤니티의 다른 사람들에 의해 채택되었습니다. University of Washington 출신의 Tianqi Chen은 Kaggle을 사용하여 XGBoost의 강력함을 입증했으며, 이는 이후 경진대회 우승의 주요 방법으로 Random Forest를 대체했습니다. Kaggle 경진대회의 결과를 바탕으로 여러 학술 논문이 출판되었으며, 이는 지속적인 혁신을 장려하는 실시간 리더보드 덕분입니다. 우승 방법은 Kaggle Winner's Blog에 자주 문서화됩니다.
진행 시스템
Kaggle은 기여와 성과에 따라 사용자를 인정하고 보상하기 위한 진행 시스템을 구현했습니다. 이 시스템은 Novice, Contributor, Expert, Master, Grandmaster의 다섯 단계로 구성됩니다. 각 단계는 경진대회, 데이터셋, 커널(코드 공유), 토론에서 특정 기준을 충족함으로써 달성됩니다.
최고 단계인 Kaggle Grandmaster는 여러 경진대회에서 최상위에 오른 사용자에게 수여되며, 단독 팀에서 높은 순위를 기록한 경우도 포함됩니다. 2025년 4월 2일 기준, 2,329만 개의 Kaggle 계정 중 2,973명이 Kaggle Master 지위를, 612명이 Kaggle Grandmaster 지위를 달성했습니다.
Kaggle Notebooks
Kaggle에는 데이터 과학과 머신러닝을 위해 설계된 Kaggle Notebooks라는 무료 브라우저 기반 온라인 통합 개발 환경이 포함되어 있습니다. 사용자는 Python 또는 R로 코드를 작성하고 실행하고, 데이터셋을 가져오고, 인기 있는 라이브러리를 사용하고, CPU, GPU 또는 TPU에서 클라우드에서 직접 모델을 훈련할 수 있습니다. 이 환경은 경진대회 제출, 튜토리얼, 교육, 탐색적 데이터 분석에 자주 사용됩니다.
의학 연구 문제
2025년 12월, The Transmitter의 기사에 따르면 Springer Nature는 '터무니없는' 데이터셋으로 신경망을 훈련시킨 약 40개의 출판물을 철회하고 제거했습니다. Kaggle에 업로드된 이 데이터셋은 자폐 아동과 비자폐 아동의 얼굴 사진 2,900장 이상을 포함했습니다. 아동이나 가족이 의학 연구 사용에 동의했을 가능성은 낮으며 윤리적 승인도 얻지 못했습니다. 이 데이터셋을 사용한 기사는 과학 문헌에서 철회되었으며, 최소 90개의 다른 출판물이 이 데이터셋의 버전을 인용합니다.
2026년 4월, 데이터 출처가 없는 두 개의 추가 데이터셋이 Kaggle에서 확인되었고 'Dozens of AI disease-prediction models were trained on dubious data'라는 제목으로 Nature에 게재되었습니다. 이 데이터셋은 125개의 임상 예측 모델에 사용되었으며, 그 중 최소 두 개는 인도네시아와 스페인의 병원에서 사용되었고, 한 기사는 의료 기기 특허에서 참조되었습니다. 2026년 6월 5일 기준, 이 데이터셋을 사용한 기사 중 5개가 철회되었습니다.
2026년 5월, Kaggle의 두 이미지 데이터셋을 사용한 추가 연구 출판물이 Scientific Reports에서 조사 대상이 되었습니다. 'Comically bad datasets used to train clinical models for stroke and diabetes'라는 제목의 Retraction Watch 기사는 이미지에 Sylvester Stallone(Rambo 역), George Clooney, Angelina Jolie, Daniel Craig와 같은 유명 배우와 아동이 포함되어 있음을 강조했습니다. 동의 없이 의학 연구에 아동 이미지를 사용하는 것은 비윤리적일 것입니다. 역방향 이미지 검색 결과 일부 이미지는 뇌졸중이 아닌 벨 마비에 대한 것임이 밝혀졌습니다. 데이터셋 중 하나는 더 이상 Kaggle에서 사용할 수 없지만 다른 하나는 남아 있으며 이미지 출처 문제를 언급하고 있습니다.