영어에서 번역됨

MS COCO는 객체 탐지, 분할, 캡셔닝을 위한 대규모 데이터셋으로, 80개 범주에 걸쳐 2.5M개의 레이블이 지정된 인스턴스가 포함된 330K개의 이미지를 포함하며, 컴퓨터 비전 모델을 벤치마킹하는 데 널리 사용됩니다.

MS COCO(Microsoft Common Objects in Context)는 객체 탐지, 분할, 이미지 캡셔닝 연구를 발전시키기 위해 설계된 대규모 이미지 데이터셋이다. 2014년 마이크로소프트가 공개했으며, 자연스러운 맥락에서 여러 객체가 포함된 일상 장면을 묘사하는 풍부한 이미지 세트를 제공하여, 단일 객체가 중앙에 배치된 초기 데이터셋의 한계를 해결했다. 이 데이터셋은 컴퓨터 비전 알고리즘, 특히 머신러닝딥러닝 분야를 평가하는 표준 벤치마크가 되었다.

MS COCO는 33만 장 이상의 이미지를 포함하며, 20만 장 이상이 레이블링되어 있고 80개 객체 범주에 걸쳐 150만 개의 객체 인스턴스가 있다. 각 이미지에는 경계 상자, 분할 마스크, 캡션과 같은 상세한 주석이 포함되어 있어 인스턴스 분할 및 이미지 캡셔닝과 같은 작업을 가능하게 한다. 객체가 일반적인 환경에 나타나는 맥락에 중점을 둔 이 데이터셋은 종종 고립된 객체를 특징으로 했던 ImageNet이나 PASCAL VOC와 같은 이전 데이터셋보다 더 도전적이고 현실적이다.

데이터셋 구조 및 주석

MS COCO 데이터셋은 세 가지 주요 분할로 구성된다: 훈련(약 118,000장), 검증(약 5,000장), 테스트(약 41,000장). 주석은 JSON 형식으로 제공되며, 범주 레이블, 다각형 기반 분할 마스크, 이미지당 5개의 사람이 작성한 캡션을 포함한다. 80개 범주는 사람, 자동차, 개, 가구와 같은 일반적인 객체를 포괄하며, 다양한 각도와 크기에서 촬영되고 종종 부분적으로 가려진 비전형적 시점에 중점을 둔다.

탐지 및 분할 외에도 MS COCO는 인간 자세 추정을 위한 키포인트 탐지 작업을 포함하며, 사람당 17개의 신체 관절이 주석 처리되어 있다. 2017년에 도입된 이 확장은 신경망 아키텍처의 자세 추정 발전을 지원했다. 이 데이터셋은 또한 영역이 짧은 구문으로 설명되는 조밀 캡셔닝과 의미 분할과 인스턴스 분할을 결합한 범주형 분할도 지원한다.

컴퓨터 비전 연구에 미친 영향

MS COCO는 도입 이후 컴퓨터 비전 분야에서 상당한 진전을 이끌었다. 2015년부터 2019년까지 개최된 연례 COCO 탐지 챌린지는 최첨단 모델을 비교하는 핵심 장소가 되었다. 우승 접근법은 종종 잔차 네트워크 백본과 특징 피라미드 네트워크를 사용했으며, 평균 정밀도(mAP)의 꾸준한 개선으로 이어졌다. 예를 들어, 2015년 우승자는 약 37% mAP를 달성했고, 2019년까지 최고 모델은 50% mAP를 초과하여 빠른 알고리즘 발전을 반영했다.

이 데이터셋은 또한 이미지 캡셔닝 모델을 훈련하고 평가하는 데 중요한 역할을 했다. 초기 캡셔닝 시스템은 주의 메커니즘을 갖춘 순환 신경망을 사용했지만, 현대 접근법은 트랜스포머 아키텍처와 대규모 언어 모델 구성 요소를 활용한다. MS COCO 캡션은 시각적 이해와 자연어 생성을 연결하는 다중 모달 모델의 표준 훈련 코퍼스가 되었다.

관련 데이터셋 및 확장

MS COCO에서 파생되거나 영감을 받은 여러 데이터셋이 있다. COCO-Stuff는 원래 사물 범주를 보완하여 하늘, 잔디, 벽과 같은 91개 스터프 클래스에 대한 픽셀 수준 의미 레이블을 추가한다. LVIS(대규모 어휘 인스턴스 분할)는 COCO의 범주를 1,200개 이상의 클래스로 확장하여 더 세분화된 벤치마크를 제공한다. 또한 COCO는 주석이 프레임 간에 전파되는 범주형 분할 및 비디오 인스턴스 분할과 같은 작업을 위한 합성 데이터셋을 만드는 데 사용되었다.

생성형 AI 맥락에서 MS COCO 이미지와 캡션은 오픈AI구글 딥마인드가 개발한 것과 같은 텍스트-이미지 모델을 훈련하는 데 자주 사용된다. 이 데이터셋의 다양한 장면과 설명적 캡션은 모델이 언어와 시각적 콘텐츠 간의 대응 관계를 학습하는 데 도움이 되며, 이는 DALL-E 및 Stable Diffusion과 같은 시스템의 기초가 된다.

한계 및 비판

널리 사용됨에도 불구하고 MS COCO에는 한계가 있다. 이 데이터셋은 서구의 도시 장면에 편향되어 있으며, 농촌 또는 비서구 환경의 표현이 제한적이어서 편향된 모델 성능을 초래할 수 있다. 80개 범주는 고정되어 있어 사전 정의된 객체 세트로 평가가 제한된다. 또한 주석 과정은 노동 집약적이고 비용이 많이 들어 더 크거나 다양한 데이터셋으로의 확장성을 제한한다.

연구자들은 또한 COCO의 평가 지표, 특히 mAP가 도메인 이동이나 적대적 예제에 대한 모델 견고성을 완전히 포착하지 못할 수 있다고 지적했다. 결과적으로 Open Images 및 Objects365와 같은 새로운 벤치마크가 등장하여 더 큰 규모나 다른 주석 유형을 제공한다. 그럼에도 불구하고 MS COCO는 수천 편의 논문에서 인용되고 많은 비전 모델의 사전 훈련 코퍼스로 사용되는 기초 자원으로 남아 있다.

유산 및 지속적 관련성

2025년 현재 MS COCO는 새로운 데이터셋의 등장에도 불구하고 객체 탐지 및 분할의 주요 벤치마크로 계속 사용되고 있다. 그 주석은 학계와 산업계에서 널리 사용되는 Detectron2 및 MMDetection과 같은 많은 오픈소스 툴킷에 통합되었다. 이 데이터셋은 또한 서로 다른 연구 그룹 간의 모델 비교를 위한 공통 기반을 제공하여 인공지능 연구의 재현성을 촉진한다.

COCO 형식은 LabelMe 및 CVAT와 같은 도구에서 채택된 사실상의 주석 표준이 되었다. 이러한 표준화는 데이터 공유와 모델 평가를 단순화하여 데이터셋의 지속적인 영향력에 기여한다. LAION-5B와 같은 대규모 데이터셋이 생성 모델 훈련에서 COCO를 규모 면에서 능가했지만, COCO의 정제된 주석과 벤치마크 지위는 엄격한 평가 환경에서의 지속적인 사용을 보장한다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·dataset·object-detection·image-captioning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사