Total-Text는 2017년 토론토 대학교 및 기타 기관의 연구자들이 도입한 장면 텍스트 검출을 위한 벤치마크 데이터셋이다. 이 데이터셋은 주로 수평 또는 대략적으로 정렬된 텍스트에 초점을 맞춘 초기 데이터셋의 한계를 해결하기 위해 설계되었으며, 곡선 및 임의 방향의 텍스트 인스턴스의 상당한 비율을 포함한다. 이 데이터셋은 장면 텍스트 검출 분야, 즉 인공지능 및 컴퓨터 비전의 하위 분야에서 머신 러닝 및 딥 러닝 모델을 위한 표준 평가 자원이 되었다.
이 데이터셋은 거리 표지판, 상점 정면, 포스터와 같은 실제 장면에서 수집된 1,555개의 이미지로 구성된다. 각 이미지는 곡선 및 다중 방향 텍스트를 포함하여 텍스트 영역을 정밀하게 윤곽을 그리는 단어 수준의 다각형 경계 상자로 주석이 달려 있다. 주석은 다각형 및 사각형 표현을 모두 지원하는 형식으로 제공되어, 검출 알고리즘의 유연한 평가를 가능하게 한다. Total-Text는 1,255개의 이미지로 구성된 훈련 세트와 300개의 이미지로 구성된 테스트 세트를 포함하며, 총 9,000개 이상의 주석이 달린 텍스트 인스턴스를 포함한다. 이 데이터셋은 축 정렬 또는 수평 텍스트를 가정하는 전통적인 검출 방법에 상당한 도전을 제기하는 높은 비율의 곡선 텍스트로 유명하다.
Total-Text는 ICDAR(국제 문서 분석 및 인식 회의) 챌린지와 같은 학술 연구 및 대회에서 텍스트 검출 시스템의 성능을 벤치마킹하는 데 널리 사용되었다. 이는 잔차 네트워크 및 U-Net 유사 분할 접근 방식에 기반한 것들을 포함한 고급 신경망 아키텍처의 개발을 촉진했으며, 데이터 증강 및 배치 정규화를 활용하여 견고성을 향상시키는 방법도 개발하게 했다.
데이터셋 구성 및 주석
Total-Text의 이미지는 다양한 도시 환경에서 수집되었으며, 다양한 언어, 글꼴, 조명 조건 및 원근감에서 텍스트를 포착한다. 주석은 단어 수준에서 수행되며, 각 단어는 곡선, 회전 또는 수평 여부에 관계없이 텍스트의 모양을 따르는 다각형으로 둘러싸여 있다. 데이터셋은 또한 각 단어에 대한 축 정렬 경계 상자의 별도 세트를 제공하며, 이는 사각형 영역을 요구하는 평가 방법에 사용될 수 있다. 기본 진실은 텍스트 파일 형식으로 저장되며, 각 줄은 단어에 해당하고 다각형 좌표와 텍스트의 전사를 포함한다.
평가 지표 및 프로토콜
Total-Text에 대한 표준 평가는 ICDAR 대회에서 확립된 프로토콜을 따르며, 정밀도, 재현율 및 F-측정을 주요 지표로 사용한다. 검출 결과는 일반적으로 0.5로 설정된 교차-대-합집합(IoU) 임계값을 기반으로 기본 진실 다각형과 일치된다. 데이터셋의 공식 평가 코드는 방법 간의 일관된 비교를 보장하기 위해 제공된다. 연구자들은 테스트 세트에서 결과를 보고하도록 권장되며, 많은 출판된 논문은 ICDAR 2015 및 MSRA-TD500과 같은 다른 데이터셋과 함께 Total-Text에 대한 비교를 포함한다.
장면 텍스트 검출 연구에 미친 영향
Total-Text는 현대 텍스트 검출 시스템의 설계에 상당한 영향을 미쳤다. 초기 방법은 수작업으로 만든 특징과 연결 구성 요소 분석에 의존했지만, 곡선 텍스트의 복잡성은 딥 러닝 접근 방식으로의 전환을 촉진했다. 많은 최첨단 모델은 이제 완전 컨볼루션 네트워크, 멀티 헤드 어텐션 메커니즘 및 인코더-디코더 아키텍처를 사용하여 텍스트 영역을 픽셀 단위로 예측한다. 이 데이터셋은 또한 종종 시퀀스-투-시퀀스 모델 및 트랜스포머 백본을 활용하는 검출과 인식을 결합한 종단 간 텍스트 스포팅 시스템을 훈련하고 평가하는 데 사용되었다.
한계 및 확장
Total-Text는 도전적인 벤치마크를 제공하지만, 일부 현대 데이터셋에 비해 상대적으로 적은 수의 이미지와 영어 텍스트에 초점을 맞춘 한계가 있다. CTW1500 및 ArT와 같은 후속 데이터셋은 더 다양한 텍스트 모양과 언어를 포함하도록 범위를 확장했다. 그럼에도 불구하고, Total-Text는 특히 곡선 및 임의 방향 텍스트를 처리하는 데 있어 텍스트 검출 알고리즘의 견고성을 평가하는 데 널리 인용되고 사용되는 자원으로 남아 있다.