영어에서 번역됨

LabelMe는 MIT CSAIL에서 만든 웹 기반 이미지 주석 도구이자 동적 데이터셋으로, 컴퓨터 비전 연구를 위해 무료로 공개 기여된 다각형 주석을 제공한다. 2010년 기준으로 187,000개 이상의 이미지와 약 659,000개의 라벨링된 객체를 포함하고 있다.

LabelMe는 MIT 컴퓨터 과학 및 인공지능 연구소에서 시작된 프로젝트로, 사용자 생성 주석과 함께 제공되는 자유롭게 접근 가능하고 진화하는 디지털 이미지 데이터셋을 제공한다. 주로 컴퓨터 비전 연구를 위해 설계되었으며, 다각형 경계를 사용하여 임의의 장면 내 여러 객체에 라벨을 지정할 수 있다. 2010년 10월 31일 기준으로 데이터셋은 187,240개의 이미지로 구성되었으며, 그중 62,197개가 주석 처리되어 658,992개의 라벨링된 객체를 포함했다. 이 프로젝트는 공개 기여가 가능하여 누구나 주석을 추가하거나 편집할 수 있으며, 연구 커뮤니티를 위한 역동적인 자원이 되고 있다.

LabelMe 이니셔티브는 초기 컴퓨터 비전 데이터셋의 한계를 해결하기 위해 등장했는데, 이러한 데이터셋은 종종 특정 연구 문제에 맞춰져 있었고 객체 외관과 장면 맥락의 다양성이 부족했다. 단일 객체의 잘린 정규화된 이미지를 특징으로 하는 전통적인 데이터셋과 달리, LabelMe는 복잡하고 수정되지 않은 장면 내에서 객체 클래스의 인식을 지원하며, 다양한 각도, 크기, 방향을 제공한다. 또한 다양한 객체 클래스를 제공하고 사용자가 새로운 클래스를 쉽게 만들 수 있게 한다.

주석 도구

LabelMe 웹 기반 주석 도구는 특별한 소프트웨어 없이도 사용자가 데이터셋에 기여할 수 있게 한다. JavaScript를 지원하는 모든 웹 브라우저를 통해 접근할 수 있으며, 이 도구는 컬렉션에서 무작위로 선택된 이미지를 표시하고 기존 다각형 주석을 고유한 색상으로 겹쳐 보여준다. 사용자는 객체 경계를 따라 점을 클릭하여 새 다각형을 그린 다음, 팝업 인터페이스를 통해 텍스트 라벨을 지정할 수 있다. 라벨은 사용자 정의로, '개', '견', '하운드'와 같은 변형이 발생한다. 주석자는 기존 다각형을 편집하거나 삭제할 수도 있으며, 변경 사항은 즉시 저장되고 공개적으로 다운로드 가능하게 되어 지속적으로 업데이트되는 커뮤니티 주도 데이터셋을 조성한다.

동기 및 설계 원칙

이 프로젝트는 초기 공개 컴퓨터 비전 데이터셋의 한계에 의해 추진되었는데, 이러한 데이터셋은 종종 특정 연구 문제에 맞춰져 있었고 새로운 연구자가 추가 데이터를 수집해야 했다. LabelMe는 단일 인스턴스가 아닌 객체 클래스의 인식을 지원하도록 설계되었으며, 임의의 장면 내에서 여러 각도, 크기, 방향의 객체를 포함한다. 잘리거나 정규화된 이미지가 있는 데이터셋과 달리, LabelMe는 다각형 윤곽을 통해 이미지당 여러 객체의 주석을 허용하여 복잡한 장면 이해를 가능하게 한다. 또한 크고 확장되는 객체 클래스 세트를 지원하고, 다양한 이미지를 포함하며, 저작권이 없는 이미지를 공개 기여와 함께 제공한다.

주석 도구

주석 도구는 JavaScript 지원 MSN이 있는 표준 웹 브라우저에서 작동하며, 사용자는 익명으로 또는 무료 계정으로 접근할 수 있다. 로드되면 도구는 데이터셋에서 무작위로 이미지를 선택하고 기존 객체 라벨을 이미지 위에 겹쳐진 색상 다각형으로 표시하며, 각 고유 라벨에는 다른 색상이 할당된다. 주석을 추가하려면 사용자가 객체 경계를 따라 점을 클릭하여 다각형을 그리고 모양을 닫아 라벨 입력 프롬프트를 트리거한다. 사용자는 적절하다고 생각되는 텍스트 라벨을 선택할 수 있으며, 윤곽을 클릭하고 라벨 텍스트를 수정하여 기존 다각형을 편집하거나 삭제할 수도 있다. 변경 사항은 즉시 저장되고 데이터셋에서 공개적으로 사용 가능해져 지속적으로 진화하는 컬렉션에 기여한다. 인터페이스에는 다음 무작위 이미지로 진행하는 '다른 이미지 보기' 링크가 포함된다.

데이터셋 특성

2010년 10월 31일 기준으로 LabelMe는 187,240개의 이미지를 포함했으며, 그중 62,197개가 주석 처리되어 총 658,992개의 라벨링된 객체가 있었다. 데이터셋의 역동적 특성으로 인해 이러한 숫자는 이후 증가했다. 이미지는 주로 인간 사진가가 촬영한 다양한 장면에서 가져와 프레임 내 객체 크기와 위치의 불균등한 분포를 초래한다. 공개 기여 모델은 주석 스타일에 변동성을 도입한다: 주석자는 어떤 객체에 라벨을 지정할지(예: 가려진 객체를 윤곽으로 표시할지 여부), 다각형 경계의 정밀도, 라벨에 사용되는 정확한 텍스트를 결정한다. 이러한 변동성은 의도적이며, 창작자는 이것이 자연스러운 라벨링 습관을 반영하고 연구자가 이러한 불일치에 강건한 알고리즘을 개발하는 데 도움이 된다고 믿는다.

관련 작업 및 영향

LabelMe는 PASCAL VOC 및 Caltech 데이터셋과 같은 컴퓨터 비전 데이터셋의 초기 노력을 기반으로 했지만, 규모와 개방성에서 차별화되었다. 역동적 특성과 커뮤니티 주도 접근 방식은 이후의 주석 플랫폼과 데이터셋에 영향을 미쳤다. 이 프로젝트는 객체 감지 및 분할 알고리즘을 훈련하고 평가하는 데 널리 사용되었으며, 머신 러닝인공지능 분야에서 대규모 공개 데이터를 향한 더 넓은 운동에 기여했다.

데이터 문제

데이터셋은 주석자에게 주어진 자유로 인해 변동성을 나타내며, 이는 특정 문제를 도입한다. 객체는 사진가가 흥미로운 대상을 중앙에 배치하는 경향이 있어 크기와 이미지 위치가 다를 수 있다. 사용자는 어떤 객체에 라벨을 지정할지 선택할 수 있어 가려진 객체나 하늘에 라벨을 지정할지 여부와 같은 불일치가 발생한다. 주석 정밀도도 사용자가 다각형의 세부 수준을 결정하므로 다양하다. 텍스트 라벨은 제한이 없어 동일한 객체가 "사람", "남자" 또는 "보행자"와 같은 다른 이름을 받을 수 있다. 창작자는 이러한 결정을 의도적으로 주석자에게 맡겼으며, 자연스러운 라벨링 변동성이 연구자가 실제 세계의 불일치에 강건한 알고리즘을 개발하는 데 도움이 된다고 믿었다.

데이터 구성 및 WordNet 통합

텍스트 라벨의 변동성을 해결하기 위해 LabelMe 팀은 WordNet을 데이터베이스에 통합했다. WordNet은 단어를 구조화된 의미 계층으로 구성하고 각 단어를 "의미"에 할당한다. 자동 의미 할당은 신뢰할 수 없는 것으로 판명되어 라벨을 WordNet 의미에 수동으로 매핑했다. 이 노력은 노동 집약적이었지만, 고유 단어 수가 다각형 수에 비해 느리게 증가했기 때문에 관리 가능했다. WordNet 통합으로 검색이 더 효과적이 되었다: "동물"을 쿼리하면 개, 고양이, 뱀과 같은 라벨링된 객체를 검색할 수 있고, "개 산책"이나 복잡한 구문으로 라벨링된 객체와 같은 관련 없는 일치 항목은 제외할 수 있었다. 시스템은 또한 차량의 부품으로서 바퀴와 같은 부분 관계 식별을 지원하여 객체 인식 연구에 대한 데이터셋의 유용성을 향상시켰다.

영향 및 응용

LabelMe는 컴퓨터 비전 연구에서 널리 사용되어 객체 감지, 분할 및 장면 이해와 같은 작업의 벤치마크를 제공했다. 개방적이고 역동적인 특성은 정적 데이터셋과 구별되며 지속적인 확장과 개선을 허용한다. 이 프로젝트는 유사한 크라우드소싱 주석 노력을 고무했으며 해당 분야의 기초 자원으로 남아 있다. 연구자들은 LabelMe를 활용하여 다양하고 실제 세계 맥락에서 객체를 인식하는 알고리즘을 훈련하고 평가했으며, 이미지 이해 및 머신 러닝컴퓨터 비전 관련 분야의 발전에 기여했다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·datasets·annotation-tools·mit
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사