영어에서 번역됨

bag-of-words 모델은 문서를 단어의 다중집합으로 변환하는 텍스트 표현 기법으로, 문법과 단어 순서를 무시합니다. 이는 자연어 처리와 머신러닝의 기초적인 방법으로, 텍스트 분류 및 검색의 기준선으로 자주 사용됩니다.

단어 가방 모델(bag-of-words model)은 자연어 처리와 정보 검색에서 사용되는 단순화된 표현 방식이다. 이 모델에서 문장이나 문서와 같은 텍스트는 단어들의 다중집합으로 표현되며, 문법과 단어 순서는 무시하되 중복은 유지한다. 이름은 텍스트가 단어들의 "가방"으로 간주될 수 있다는 아이디어에서 유래했으며, 여기서 구조는 사라지고 단어의 개수만 중요하다. 이는 기계 학습인공 지능에서 텍스트 분류, 감정 분석, 문서 검색과 같은 작업을 위한 일반적인 기준선이다.

작동 방식

단어 가방 표현의 구축은 토큰화, 즉 텍스트를 개별 단어나 토큰으로 분할하는 과정에서 시작된다. 구두점은 일반적으로 제거되며, 단어는 종종 소문자로 변환된다. 그런 다음 문서 모음에 나타나는 모든 고유 토큰으로 어휘집이 구축된다. 각 문서는 개수 벡터로 변환되며, 각 차원은 어휘집의 단어에 해당하고 값은 해당 단어가 문서에 나타나는 횟수이다. 이 벡터는 희소하며, 대부분의 문서는 어휘집의 작은 일부만 포함하기 때문이다.

예를 들어, "the cat sat on the mat"이라는 문장은 개수 벡터를 생성한다. "the"는 두 번 나타나고, "cat", "sat", "on", "mat"은 각각 한 번씩 나타난다. 단어 순서는 완전히 무시되므로, "the cat sat"과 "sat cat the"는 동일한 표현을 산출한다. 이러한 순서 정보의 손실은 모델의 주요 한계이지만, 표현을 단순하고 계산적으로 효율적으로 만든다.

응용 및 한계

단어 가방 표현은 심층 학습이 등장하기 전에 고전적인 기계 학습 파이프라인에서 널리 사용되었다. 이는 로지스틱 회귀, 서포트 벡터 머신, 나이브 베이즈 분류기와 같은 알고리즘의 입력 특성으로 사용된다. 정보 검색에서 1975년 Gerard Salton과 동료들이 도입한 벡터 공간 모델은 문서와 질의를 단어 가방 벡터로 표현하고 코사인 유사도로 비교한다.

이 모델에는 몇 가지 알려진 한계가 있다. 단어 순서를 포착할 수 없으므로 "not good"과 "good not" 같은 구문은 동일하게 처리된다. 또한 의미론을 무시한다. "car"와 "automobile" 같은 동의어는 별도의 차원으로 처리되는 반면, "bank" 같은 다의어는 하나로 합쳐진다. 결과 벡터는 고차원적이고 희소하며, 어휘집이 클 때 과적합과 일반화 성능 저하로 이어질 수 있다. 이러한 문제를 완화하기 위해 실무자들은 종종 TF-IDF(term frequency-inverse document frequency)와 같은 가중치 기법을 적용하거나 n-gram을 사용하여 짧은 시퀀스를 포착한다.

변형 및 확장

여러 확장이 기본 단어 가방 모델의 약점을 해결한다. TF-IDF는 원시 개수를 일반적인 단어의 가중치를 낮추고 희귀한 단어를 강조하는 가중치로 대체한다. N-gram 모델은 n개 단어의 연속 시퀀스를 포함하도록 가방을 확장하여 일부 지역 순서 정보를 보존한다. 해싱 트릭은 해시 함수를 사용하여 단어를 고정 크기 벡터로 매핑하므로 어휘집을 저장할 필요가 없다. 이러한 방법은 특히 레이블이 지정된 데이터가 부족할 때 많은 응용 분야에서 여전히 유용하다.

또 다른 중요한 확장은 단어 임베딩의 사용으로, 단어를 의미적 유사성을 포착하는 밀집 저차원 벡터로 매핑한다. 단어 가방과 달리 임베딩은 단어 간의 일부 관계를 보존한다. 그러나 임베딩은 일반적으로 신경망 방법을 사용하여 학습되며, 더 많은 데이터와 계산이 필요하다. 단어 가방 모델은 여전히 강력한 기준선이다. 많은 텍스트 분류 작업에서 단어 가방 특성에 대한 선형 분류기는 더 복잡한 모델의 성능과 일치할 수 있다.

현대 AI와의 관계

대규모 언어 모델트랜스포머 아키텍처의 출현으로 단어 가방 표현은 복잡한 자연어 이해 작업에서 대체로 대체되었다. 2017년에 도입된 트랜스포머 아키텍처는 위치 인코딩을 사용하여 단어 순서 정보를 주입하고 다중 헤드 어텐션을 사용하여 시퀀스의 모든 단어 간 관계를 모델링한다. 이러한 메커니즘은 모델이 단어 가방 표현으로는 보이지 않는 맥락과 장거리 의존성을 포착할 수 있게 한다. 시퀀스-투-시퀀스인코더-디코더 모델과 같은 아키텍처도 개수 기반 벡터 대신 학습된 임베딩에 의존한다.

그럼에도 불구하고 단어 가방 모델은 현대 AI에 계속 영향을 미친다. 이는 종종 하이브리드 시스템의 특성 추출 단계로 사용되며, 그 단순성은 기계 학습 개념을 이해하는 유용한 교육 도구로 만든다. 이 모델은 또한 생성 AI 응용 프로그램에서 더 정교한 표현을 평가하기 위한 기준선으로 나타난다. 심층 학습이 발전함에 따라 단어 가방 모델은 자연어 처리 역사에서 여전히 기본 개념으로 남아 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:natural-language-processing·text-representation·machine-learning·information-retrieval
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사