COCO-Text는 자연 장면에서의 텍스트 감지 및 인식을 위해 설계된 대규모 데이터셋이다. 이 데이터셋은 20만 개 이상의 레이블링된 이미지를 포함하는 Microsoft COCO(Common Objects in Context) 이미지 컬렉션을 기반으로 구축되었다. COCO-Text는 이러한 이미지 내의 텍스트 인스턴스에 특별히 초점을 맞추며, 텍스트 영역, 해당 전사(transcription), 추가 속성에 대한 주석을 제공한다. 이 데이터셋은 2016년 Google 및 다른 기관의 연구자들에 의해 소개되었으며, 컴퓨터 비전 분야에서 텍스트 감지 및 인식 알고리즘을 평가하는 표준 벤치마크가 되었다.
COCO-Text의 주요 목적은 거리 표지판, 상점 간판, 제품 라벨과 같은 제약 없는 환경에서 텍스트를 찾고 읽을 수 있는 모델의 개발 및 평가를 지원하는 것이다. 스캔된 문서나 통제된 환경에 초점을 맞춘 초기 데이터셋과 달리, COCO-Text는 다양한 조명, 원근 왜곡, 복잡한 배경을 포함한 실제 세계 이미지의 도전 과제를 강조한다. 이 데이터셋은 기계 인쇄 텍스트와 손글씨 텍스트를 모두 포함하며, 각 텍스트 인스턴스가 읽을 수 있는지 여부를 나타내는 주석을 제공한다.
데이터셋 구성
COCO-Text는 63,686개의 이미지를 포함하며, 훈련(43,686개 이미지), 검증(10,000개 이미지), 테스트(10,000개 이미지) 세트로 분할된다. 각 이미지는 불규칙한 모양을 포착하기 위해 사각형이 아닌 경계 다각형으로 표현되는 텍스트 인스턴스로 주석이 달린다. 각 텍스트 인스턴스에 대해 데이터셋은 전사(실제 텍스트 내용), 가독성 플래그(읽을 수 있음 또는 읽을 수 없음), 그리고 기계 인쇄, 손글씨, 기타 중 하나의 범주로 분류를 제공한다. 주석은 자동화된 방법과 인간 크라우드소싱의 결합을 통해 생성되어 높은 수준의 정확성을 보장한다.
이 데이터셋은 총 145,000개 이상의 텍스트 인스턴스를 포함하며, 이미지당 평균 약 2.3개의 텍스트 인스턴스가 있다. 텍스트 인스턴스는 단일 문자부터 전체 문장까지 길이가 다양하며, 다양한 글꼴, 크기, 방향을 포함한다. 이러한 다양성은 COCO-Text를 기계 학습 모델, 특히 심층 학습 아키텍처 기반 모델에게 도전적인 벤치마크로 만든다.
주석 세부 사항
COCO-Text의 각 텍스트 인스턴스는 훈련 및 평가에 중요한 일련의 속성으로 주석이 달린다. 경계 다각형은 점 목록으로 정의되어 곡선 또는 회전된 텍스트의 정밀한 위치 파악을 가능하게 한다. 전사 필드는 인식 작업에 사용되는 정확한 문자열을 포함한다. 가독성 속성은 텍스트가 인간이 읽을 수 있는지 여부를 나타내며, 읽을 수 없는 텍스트는 노이즈가 많거나 부분적으로 가려진 텍스트에 대한 모델의 견고성을 테스트하기 위해 자주 포함된다.
또한 각 텍스트 인스턴스는 '기계 인쇄', '손글씨', '기타'의 세 가지 범주 중 하나로 분류된다. 이 분류는 다양한 텍스트 유형에 따른 모델 성능 분석에 도움이 된다. 데이터셋은 또한 원본 COCO 이미지 ID와 같은 이미지 수준 메타데이터를 제공하여 연구자들이 다중 작업 학습을 위해 다른 COCO 주석(예: 객체 감지 레이블)과 교차 참조할 수 있게 한다.
벤치마크 사용
COCO-Text는 텍스트 감지 및 인식 작업의 벤치마크로 널리 사용된다. ICDAR(국제 문서 분석 및 인식 회의) 견고한 읽기 대회를 포함한 여러 국제 대회에서 채택되었다. 데이터셋은 감지에 대한 정밀도, 재현율, F-측정 및 인식에 대한 단어 정확도와 같은 표준 지표를 계산하는 평가 스크립트를 제공한다. 이러한 지표는 과적합을 방지하기 위해 숨겨진 주석이 있는 테스트 세트에서 계산된다.
연구자들은 전통적인 컴퓨터 비전 방법부터 현대 신경망 접근 방식에 이르기까지 다양한 모델을 훈련하고 평가하기 위해 COCO-Text를 사용해 왔다. 특히 합성곱 신경망(CNN)과 순환 신경망(RNN) 기반의 심층 학습 모델은 이 데이터셋에서 최첨단 성능을 달성했다. 데이터셋은 또한 대규모 이미지 데이터셋에서 사전 훈련된 모델이 텍스트 감지를 위해 미세 조정되는 전이 학습 연구에도 사용되었다.
관련 데이터셋 및 확장
COCO-Text는 ICDAR 2013, ICDAR 2015, Total-Text를 포함한 더 넓은 장면 텍스트 데이터셋 계열의 일부이다. 그러나 COCO-Text는 규모와 COCO 생태계와의 통합으로 차별화된다. 출시 이후 여러 확장 및 변형이 제안되었다. 예를 들어, 나중에 소개된 COCO-Text-OCR 데이터셋은 문자 수준 경계 상자를 포함한 텍스트 인식용 추가 주석을 제공한다. 이러한 확장은 연구를 위한 COCO-Text의 유용성을 더욱 높였다.
또한 COCO-Text는 더 포괄적인 벤치마크를 만들기 위해 다른 데이터셋과 함께 사용되었다. 예를 들어, Open Images 데이터셋은 COCO-Text를 보완하는 텍스트 주석을 포함하여 더 큰 규모의 훈련을 가능하게 한다. 이러한 데이터셋의 가용성은 자율 주행, 보조 기술, 이미지 검색과 같은 응용 프로그램의 중요한 구성 요소인 장면 텍스트 이해 분야의 발전을 가속화했다.
도전 과제 및 한계
강점에도 불구하고 COCO-Text에는 특정 한계가 있다. 대부분의 주석이 영어로 되어 있어 데이터셋이 영어 텍스트에 편향되어 있다. 이는 다국어 시나리오에 대한 적용 가능성을 제한한다. 또한 주석 프로세스는 철저하지만, 특히 작거나 왜곡된 텍스트의 전사에 오류가 포함될 수 있다. 데이터셋은 시간 정보를 포함하지 않으므로 비디오 기반 텍스트 감지 작업에는 사용할 수 없다.
또 다른 도전 과제는 텍스트 범주의 불균형이다. 기계 인쇄 텍스트가 지배적이며 손글씨 텍스트는 상대적으로 드물다. 이는 인쇄 텍스트에서는 잘 작동하지만 손글씨에서는 성능이 낮은 모델로 이어질 수 있다. 연구자들은 이러한 격차를 해결하기 위해 COCO-Text를 다른 데이터셋으로 보강해야 하는 경우가 많다. 그럼에도 불구하고 COCO-Text는 컴퓨터 비전 커뮤니티의 기초 자원으로 남아 있으며, 그 영향은 이를 인용하는 수많은 논문과 시스템에서 분명하다.