METEOR(명시적 순서를 고려한 번역 평가 지표)는 기계 번역 출력의 품질을 평가하기 위한 지표이다. 이 지표는 단일 단어 정밀도와 재현율의 조화 평균을 기반으로 점수를 계산하며, 재현율에 정밀도보다 더 높은 가중치를 부여하고, 정확한 단어 일치 외에도 어간 추출 및 동의어 일치를 통합한다. 이 지표는 BLEU 지표의 한계를 해결하고 문장 또는 세그먼트 수준에서 인간 판단과의 더 강한 상관관계를 생성하기 위해 개발되었으며, BLEU는 말뭉치 수준에서의 상관관계를 목표로 한다.
이 지표는 2005년 6월 미시간주 앤아버에서 열린 제43회 전산언어학회 연례 회의에서 개최된 기계 번역 및 요약의 내재적·외재적 평가 척도 워크숍에서 소개되었다. 보고된 결과에 따르면 말뭉치 수준에서 인간 판단과의 상관관계가 최대 0.964에 달했으며, 동일한 데이터 세트에서 BLEU의 0.817과 비교되었다. 문장 수준에서 보고된 최대 상관관계는 0.403이었다. 이 지표의 이름은 명시적 순서를 고려한 번역 평가 지표를 뜻하는 재귀 약어이다.
동기 및 설계
METEOR는 부분적으로 기계 번역 평가의 표준이 된 초기 BLEU 지표의 한계에 대응하여 개발되었다. BLEU는 주로 말뭉치 수준에서 작동하며 제한된 n-그램 정밀도를 가진 정확한 단어 일치에 의존한다. 개별 문장에 적용했을 때 인간 판단과의 상관관계가 약한 것으로 나타났다. METEOR는 재현율을 정밀도보다 더 높게 가중치를 부여하고(조화 평균에서 9:1 비율), 정확한 표면 형태를 넘어선 일치를 위한 언어학적 자원을 통합하며, 세그먼트 수준에서 의미 있게 비교할 수 있는 점수를 생성함으로써 이러한 단점을 해결했다.
점수 계산 절차는 정렬 단계로 시작된다. 알고리즘은 후보 번역의 단일 단어와 참조 번역의 단일 단어 간의 매핑을 구축한다. 후보의 각 단일 단어는 참조의 최대 하나의 단일 단어에 매핑될 수 있다. 동일한 수의 매핑으로 여러 정렬이 가능한 경우, 알고리즘은 매핑 선 간의 교차가 더 적은 정렬을 선호하며, 이는 단조롭고 연속적인 일치를 선호한다.
일치 단계
METEOR는 여러 단계로 일치를 적용한다. 첫 번째 단계는 정확한 단어 일치를 사용한다. 이후 단계에서는 어간 추출 및 동의어에 기반한 일치를 추가하며, 영어의 경우 WordNet과 같은 자원을 활용한다. 각 단계는 이전 단계에서 이미 일치되지 않은 단일 단어만 추가한다. 이러한 단계적 접근 방식은 의미적으로 동등하지만 어휘적으로 다른 표현을 인정할 수 있게 하며, 이는 초기 지표에는 없던 기능이다.
정렬 후, 정밀도와 재현율은 일치된 단일 단어 수에서 계산된다. 최종 F-평균 점수에서 재현율은 정밀도보다 더 높은 가중치를 가지며, 공식 10PR/(R+9P)를 사용한다. 이러한 가중치는 번역 품질에서 재현율이 인간 판단과 더 강한 상관관계를 가진다는 발견을 반영한다. 최종 점수는 일치된 단일 단어의 청크 수에서 파생된 조각화 패널티로 조정되며, 더 긴 연속 일치는 더 적은 청크와 더 낮은 패널티를 생성한다.
알고리즘 개요
알고리즘은 문장 쌍(후보 번역과 참조 번역)에 대해 작동한다. 제약 조건 하에서 단일 단어를 매핑하여 정렬을 구성하며, 교차가 더 적은 정렬을 선호한다. 일치는 단계적으로 진행되며, 각 단계는 정확한 단어 형태, 그 다음 어간, 그 다음 동의어에 기반한 일치를 추가한다. 정렬 후, 단일 단어 정밀도는 일치된 단일 단어 수를 후보의 총 단일 단어 수로 나눈 값이고, 재현율은 참조의 총 단일 단어 수로 나눈 값이다. 이들은 재현율이 정밀도보다 9배 더 높은 가중치를 가진 조화 평균으로 결합된다. 그런 다음 일치된 단일 단어가 연속 청크로 얼마나 조각화되었는지에 따라 패널티가 적용되며, 인접하지 않은 일치가 많은 번역은 더 높은 패널티를 받아 최종 점수가 최대 50%까지 감소한다.
말뭉치의 경우, 모든 세그먼트에 걸쳐 집계 정밀도, 재현율 및 패널티 값이 계산된다. 여러 참조 번역이 제공되면 후보는 각각에 대해 점수가 매겨지고 가장 높은 점수가 유지된다.
BLEU와의 비교
BLEU는 더 일찍 도입되었으며, 간결성 패널티가 있는 n-그램 중복을 측정하고 기계 번역 연구에서 널리 사용된다. 그러나 정확한 단어 일치에 의존하며 동의어나 형태론적 변형을 고려하지 않는다. METEOR는 어간 추출과 동의어 매핑을 사용하고 재현율에 더 높은 가중치를 부여함으로써 이러한 문제를 극복하도록 설계되었다. 보고된 실험에 따르면 METEOR는 말뭉치 수준에서 인간 판단과의 상관관계가 최대 0.964에 달했으며, 동일한 데이터에서 BLEU는 0.817을 달성했다. 세그먼트 수준에서 METEOR는 최대 상관관계 0.403을 보였으며, 지지자들은 이것이 개별 문장 평가에 더 적합하다고 주장했다.
알고리즘 세부 사항
METEOR의 정렬 과정은 후보 번역의 단일 단어를 참조 번역의 단일 단어에 매핑하며, 각 후보 단일 단어는 최대 하나의 참조 단일 단어에 매핑된다. 알고리즘은 가장 많은 매핑 수를 가진 정렬을 선택하며, 두 정렬이 동일한 매핑 수를 가질 때는 일치된 단일 단어 간의 교차 선이 더 적은 것을 선택한다. 일치는 단계적으로 진행된다: 먼저 정확한 단어 일치, 그 다음 어간 일치(어간 추출 도구 사용), 그 다음 동의어 일치. 각 단계는 이전 단계에서 아직 일치되지 않은 단일 단어에 대한 매핑만 추가한다.
최종 정렬이 계산된 후, 정밀도 P와 재현율 R이 계산된다. 조화 평균 Fmean은 10PR/(R+9P)로 정의되며, 재현율에 정밀도의 9배 가중치를 부여한다. 유창성과 어순을 고려하기 위해 알고리즘은 일치된 단일 단어를 가능한 가장 적은 수의 청크로 그룹화하며, 청크는 후보와 참조 모두에서 인접한 단일 단어 집합이다. 패널티 p는 0.5 × (c/um)^3으로 계산되며, 여기서 c는 청크 수이고 um은 매핑된 단일 단어 수이다. 최종 세그먼트 점수는 Fmean에 (1 - p)를 곱한 값이다.
응용 및 확장
METEOR는 기계 번역 평가 캠페인, 특히 문장 수준 신뢰성이 중요한 공유 과제와 시스템 비교에서 사용되어 왔다. 세그먼트 수준에서 적용될 수 있기 때문에 말뭉치 수준 지표가 쉽게 지원할 수 없는 방식으로 번역 출력을 튜닝하고 분석하는 데 유용하다. 시간이 지남에 따라 변형과 확장이 등장했으며, 다양한 언어 쌍과 요약 평가에 맞춘 버전이 포함된다. 이 지표는 또한 이미지 캡셔닝과 같은 관련 분야의 후속 평가 접근 방식에 영향을 미쳤으며, 여기서 동의어 일치와 n-그램 중복이 유용한 것으로 입증되었다.
한계
이 지표는 여전히 참조 번역에 의존하며 어휘 중복이 암시하는 것 이상의 유창성과 같은 번역 품질 측면을 포착하지 못한다. 사전 정의된 동의어 자원에 대한 의존성은 도메인 특화 용어나 그러한 자원이 부족한 언어에서 성능을 제한할 수 있다. 초기 실험에서 말뭉치 수준의 인간 판단과의 상관관계가 높은 것으로 보고되었지만, 문장 수준 상관관계는 여전히 중간 수준으로 남아 있어 세그먼트 수준 자동 평가의 고유한 어려움을 반영한다. 이후 변형과 대체 지표는 이러한 아이디어를 계속 발전시켜 왔다.