영어에서 번역됨

LVIS(大型词汇表实例分割)是一个用于长尾视觉识别的数据集,包含超过200万个高质量实例分割掩码,涵盖1,203个对象类别,旨在对AI模型在稀有和常见对象上的性能进行基准测试并加以改进。

LVIS(대규모 어휘 인스턴스 분할, Large Vocabulary Instance Segmentation)은 컴퓨터 비전과 머신 러닝에서 인스턴스 분할 및 객체 탐지 모델을 평가하고 훈련하는 데 사용되는 데이터셋이다. 이 데이터셋은 2019년 Facebook AI Research(현재 Meta AI의 일부)의 연구자들에 의해 소개되었으며, 대부분의 객체 범주가 드물게 나타나는 실제 세계의 긴 꼬리 분포를 해결하기 위해 설계되었다. 기존 데이터셋은 흔한 클래스의 작은 집합에 초점을 맞춘 반면, LVIS는 일상적인 물건(예: '바나나')부터 희귀한 물건(예: '트리케라톱스 두개골')에 이르기까지 1,203개의 객체 범주를 포함하는 대규모 어휘를 제공한다. 이 데이터셋은 COCO 데이터셋에서 가져온 약 164,000개의 이미지에 대해 200만 개 이상의 고품질 인스턴스 분할 마스크를 포함한다.

데이터셋 구조 및 주석

LVIS는 COCO 데이터셋을 기반으로 구축되었으며, COCO의 훈련 및 검증 이미지 164,000장을 사용하지만 범주 집합은 훨씬 더 확장되었다. 각 이미지는 픽셀 수준에서 객체 인스턴스의 윤곽을 그리는 인스턴스 분할 마스크로 주석이 달려 있으며, 단순히 경계 상자만 제공하는 것이 아니다. 주석 과정은 철저함을 강조하여 설계되었으며, 주석자는 작거나, 가려졌거나, 흐릿한 객체를 포함하여 이미지에 존재하는 모든 범주의 모든 인스턴스를 표시해야 한다. 이는 80개의 범주만 주석하고 드문 객체를 종종 생략했던 COCO와의 주요 차이점이다. 데이터셋은 COCO와 유사한 형식의 JSON 파일로 제공되며, 이미지 ID, 범주 ID, 분할 폴리곤 및 경계 상자 필드를 포함한다. 범주 목록은 WordNet 동의어 집합과 수동 선택의 조합을 통해 선별되어 일상 용품, 동물, 음식 및 도구를 광범위하게 포함한다.

벤치마크 및 평가 지표

LVIS의 주요 평가 지표는 표준 COCO 스타일의 평균 정밀도(AP)로, 여러 Intersection over Union(IoU) 임계값(0.5~0.95)에서 계산된다. 그러나 LVIS는 중요한 차이점을 도입한다. AP는 세 가지 빈도 그룹(드문 그룹, 일반 그룹, 흔한 그룹)에 대해 별도로 보고되며, 전체 AP는 모든 범주에 대한 단순 평균이 아닌 세 그룹 AP의 평균으로 계산된다. 이러한 '균형 잡힌' AP는 드문 범주에서의 성능이 흔한 범주에 의해 가려지지 않도록 보장하여, 긴 꼬리 일반화를 더 민감하게 측정한다. 예를 들어, '사람'에서는 잘 수행하지만 '바리석'에서는 성능이 낮은 모델은 COCO에서는 높은 점수를 받을 수 있지만 LVIS에서는 낮은 점수를 받게 된다. 벤치마크는 또한 인스턴스 분할을 위한 '마스크 AP'와 객체 탐지를 위한 '박스 AP'를 포함하며, 주요 리더보드는 마스크 AP에 초점을 맞춘다.

긴 꼬리 학습에 미친 영향

LVIS는 불균형 데이터에 대한 모델 훈련을 다루는 긴 꼬리 학습(long-tail learning) 연구의 표준 테스트베드가 되었다. 데이터셋의 설계는 이 분야에서 많은 알고리즘 혁신을 촉발했다. 주목할 만한 예로는 LVIS 저자들이 제안한 '연합 손실(federated loss)'이 있는데, 이는 범주를 빈도에 따라 '연합' 집합으로 그룹화하고 각 그룹에 대해 소프트맥스를 계산하여 손실 함수에서 드문 범주가 흔한 범주에 압도당하는 것을 방지한다. 또 다른 예로는 '동적 기울기 클리핑(dynamic gradient clipping)'이 있는데, 이는 훈련 중 드문 범주의 기울기 크기를 조정한다. 후속 연구에서는 특성 학습과 분류기 미세 조정을 분리하는 단계별 훈련, 드문 클래스를 위한 데이터 증강 기법, 더 나은 특성 추출을 위한 신경망 아키텍처 개선 등을 탐구했다.

관련 데이터셋 및 확장

LVIS는 여러 파생 데이터셋과 관련 연구 노력을 탄생시켰다. LVIS 챌린지는 동일한 1,203개 범주에 대한 주석이 포함된 20,000장의 검증 이미지와 테스트 세트를 제공한다. 2020년에는 저자들이 주석 오류를 수정하고 훈련 세트를 원래 57,000장에서 100,000장으로 확장한 LVIS v1.0을 출시하여 일관성을 개선했다. 또한 개방형 어휘 인스턴스 분할을 위해 설계된 LVIS-OW(Open World) 변형이 도입되었으며, 여기서 모델은 훈련 중에 볼 수 없었던 객체를 식별해야 한다. LVIS는 Detectron2 프레임워크에 통합되어 연구자들이 모델을 쉽게 훈련하고 평가할 수 있게 되었다. 이 데이터셋의 범주 목록은 panoptic segmentation 및 비디오 인스턴스 분할과 같은 다른 작업에서도 공통 어휘로 사용되었다. 성공에도 불구하고 LVIS에는 한계가 있다. COCO 이미지에서 파생되었기 때문에 웹 사진에 대한 편향이 있으며, 범주 집합이 크지만 여전히 유한하다. Ego4D 프로젝트와 같은 미래 데이터셋은 LVIS의 원칙을 기반으로 더욱 다양한 실제 시나리오를 포괄하도록 범위를 확장하고 있다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·dataset·long-tail-recognition·instance-segmentation
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사