자동 의미 태깅 말뭉치 획득은 대규모 텍스트 컬렉션에서 단어의 출현에 올바른 의미를 할당하기 위해 계산 방법을 사용하는 과정을 말하며, 인간의 주석에만 의존하지 않는다. 자연어 처리에서 의미 태깅 말뭉치는 각각의 모호한 단어(예: 금융 기관 또는 강둑으로서의 "bank")가 그 문맥에서 의도된 특정 의미로 레이블된 데이터셋이다. 수동 태깅은 정확하지만 비용이 많이 들고 느려서 말뭉치 크기를 제한한다. 자동 획득은 알고리즘, 통계 모델, 그리고 점점 더 Machine learning 기법을 활용하여 이러한 레이블을 대규모로 생성하며, 강건한 단어 의미 중의성 해소 시스템의 훈련을 가능하게 한다.
이 분야는 구조화된 의미 목록을 제공한 WordNet과 같은 초기 어휘 자원에서 출발했다. 초기 접근법은 수작업으로 만든 규칙과 사전 정의를 사용했지만, 이는 취약한 것으로 드러났다. 1990년대 지도 학습의 도래, 특히 작은 수동 주석 시드 말뭉치로 훈련된 분류기의 등장은 전환점을 만들었다. 그러나 병목 현상은 여전히 주석 비용이었다. 자동 획득 방법은 제한된 시드에서 부트스트래핑하거나, 지식 베이스를 사용하거나, 반지도 및 비지도 패러다임을 통해 레이블되지 않은 데이터를 활용하는 것을 목표로 한다.
부트스트래핑 및 반지도 방법
부트스트래핑은 자동 의미 태깅 말뭉치 획득의 초석이다. 이 접근법은 대상 단어의 각 의미에 대해 수동으로 태깅된 작은 예시 집합(시드 데이터)으로 시작한다. 분류기가 이 시드로 훈련된 다음 대규모 레이블되지 않은 말뭉치에 적용된다. 높은 신뢰도의 예측이 훈련 집합에 추가되고, 이 과정이 반복된다. 종종 자기 훈련 또는 공동 훈련이라고 불리는 이 방법은 적당한 초기 노력으로 수백 개에서 수백만 개의 태깅된 인스턴스로 말뭉치를 확장할 수 있다.
주목할 만한 변형은 Yarowsky 알고리즘(1995)으로, 결정 목록과 담화 내 단일 의미 및 연어 내 단일 의미 가정을 사용했다. 이러한 가정은 단어가 문서 내에서 또는 특정 연어와 함께 나타날 때 단일 의미를 가지는 경향을 활용한다. 이 알고리즘은 영어 말뭉치에서 높은 정확도를 달성하여, 자동 획득이 많은 단어에 대해 수동 품질에 필적할 수 있음을 보여주었다. 이후 연구는 Neural network 분류기로 이를 개선하여 도메인 전반에 걸친 강건성을 향상시켰다.
지식 기반 및 사전 기반 접근법
레이블된 시드 대신, 지식 기반 방법은 외부 자원에서 의미 레이블을 도출한다. 예를 들어, Lesk 알고리즘(1986)은 단어의 문맥과 해당 의미의 사전 정의 사이의 중첩을 비교한다. 원래 중의성 해소를 위해 사용되었지만, 모든 모호한 토큰에 알고리즘을 적용하여 말뭉치를 태깅하도록 적응될 수 있다. 더 현대적인 접근법은 WordNet과 같은 의미 네트워크를 사용하여 그래프 기반 측정(예: WordNet 그래프에서의 PageRank)으로 문맥 단어와 의미 용어 사이의 유사성을 계산한다.
이러한 방법은 완전히 자동이며 수동 주석이 필요 없지만, 정확도는 일반적으로 지도 접근법보다 낮다. 이는 시드 말뭉치가 없는 저자원 언어나 도메인에서 가치가 있다. 하이브리드 시스템은 지식 기반 점수와 부트스트래핑을 결합하여, 사전 정의로 초기 의사 레이블을 생성한 다음 지도 분류기로 정제한다.
비지도 및 클러스터링 기반 획득
비지도 방법은 사전 정의된 의미 목록 없이 원시 텍스트에서 직접 의미 구분을 발견하는 것을 목표로 한다. 클러스터링 알고리즘은 문맥 특징(예: 주변 단어, 구문 의존성)을 기반으로 단어의 출현을 그룹화한다. 각 클러스터는 별개의 의미를 나타내는 것으로 가정된다. 이 접근법은 외부 자원 없이 의미 태깅 말뭉치를 생성할 수 있지만, 결과 의미 클러스터는 WordNet과 같은 인간이 정의한 의미와 일치하지 않을 수 있다.
잠재 디리클레 할당(LDA) 또는 신경 임베딩(예: Transformer (architecture) 기반 문맥 임베딩)과 같은 기법이 단어 문맥을 표현하는 데 사용되었다. 이러한 임베딩을 클러스터링하면 종종 일관된 의미 그룹이 생성된다. 그러나 평가는 금본위가 없기 때문에 어렵다. 비지도 획득은 종종 탐색적 분석이나 표준 목록에 매핑될 후보 의미를 생성하는 전처리 단계로 사용된다.
평가 및 과제
자동으로 획득된 의미 태깅 말뭉치를 평가하려면 Senseval/Semeval 대회와 같은 수동 주석 금본위와의 비교가 필요하다. 지표에는 단어별 정밀도, 재현율, F1 점수가 포함된다. 정확도는 크게 다양하다: 명확한 문맥 단서가 있는 일반적인 모호한 단어의 경우 자동 방법이 90% 이상의 정확도를 초과할 수 있지만, 희귀 의미 또는 문맥에 크게 의존하는 단어의 경우 성능이 크게 떨어진다.
주요 과제에는 도메인 적응(뉴스로 훈련된 모델이 생의학 텍스트에서 실패할 수 있음), 의미 세분성(세밀한 의미는 거친 의미보다 어려움), 그리고 다중 단어 표현의 존재가 포함된다. 또한 부트스트래핑이 초기 오류를 강화하면 자동 획득이 오류를 전파할 수 있다. Large language model 임베딩과 Deep learning 아키텍처를 사용한 최근 발전은 성능을 개선했지만, 완전히 자동화된 고품질 의미 태깅은 여전히 열린 문제로 남아 있다. 2020년대 중반 현재, 최첨단 시스템은 지도 시드와 대규모 사전 훈련 모델을 결합하여 일반적인 단어에 대한 벤치마크 데이터셋에서 인간에 가까운 성능을 달성하지만, 희귀 의미는 여전히 인간의 개입이 필요하다.
응용
의미 태깅 말뭉치는 단어 의미 중의성 해소 시스템을 훈련하고 평가하는 데 기본적이며, 이는 기계 번역(올바른 대상 단어 선택), 정보 검색(쿼리 용어 중의성 해소), 사전 편찬(사전 편찬)에 사용된다. 또한 의미 역할 레이블링과 온톨로지 학습을 지원한다. 대규모 자동 획득 말뭉치의 가용성은 더 정확한 언어 이해 모델의 개발을 가능하게 하여 Artificial intelligence 및 자연어 처리의 발전에 기여했다.
요약하면, 의미 태깅 말뭉치의 자동 획득은 주석 병목 현상에 대한 실용적인 해결책으로, 계산 방법을 활용하여 대규모 레이블 데이터를 생성한다. 완벽하지는 않지만 어휘 의미론에서 상당한 진전을 가능하게 했으며, 특히 현대 신경 아키텍처의 통합과 함께 활발한 연구 영역으로 남아 있다.