컨텍스트 창

영어에서 번역됨

컨텍스트 창은 언어 모델이 응답을 생성할 때 한 번에 처리할 수 있는 최대 텍스트 양으로, 토큰 단위로 측정되며 프롬프트와 자체 출력을 모두 포함합니다.

컨텍스트 창은 언어 모델이 한 번에 고려할 수 있는 최대 텍스트 양으로, 토큰 단위로 측정되며 사용자가 제공한 프롬프트, 시스템 지침, 검색된 문서, 그리고 모델이 지금까지 생성한 출력을 모두 포함한다. 이는 모델의 작업 기억으로 기능하며, 컨텍스트 창 밖의 정보는 명시적으로 다시 제공되지 않는 한 생성 시점에 모델에게 보이지 않는다.

기술적 기반

컨텍스트 창의 크기는 Transformer (architecture) 아키텍처의 핵심인 어텐션 메커니즘에 의해 제한되며, 이 메커니즘은 입력의 모든 토큰 쌍 간의 관계를 계산한다. 표준 공식에서 이 계산은 시퀀스 길이에 따라 이차적으로 확장되므로, 컨텍스트 창을 두 배로 늘리면 처리에 필요한 계산량과 메모리가 대략 네 배로 증가하여, 역사적으로 긴 컨텍스트 창을 서비스하는 데 비용이 많이 들었다. 이후 희소 및 창 기반 어텐션 변형, 키-값 캐시 압축, 전문화된 메모리 관리 등의 엔지니어링 기법이 이 비용을 충분히 줄여 훨씬 더 큰 창을 상업적으로 실용적으로 만들었다.

시간에 따른 성장

초기 트랜스포머 기반 언어 모델은 수백에서 수천 토큰만 지원했으며, 2020년 OpenAI가 출시한 GPT-3는 약 2,048 토큰을 지원했다. 이후 몇 년 동안 컨텍스트 창은 꾸준히 확장되어, 2023년에 출시된 GPT-4는 최대 32,000 토큰을 지원하는 변형을 제공했고, 2024년에는 여러 연구소가 수십만 토큰의 컨텍스트 창을 제공했다. Google DeepMindGemini는 백만 토큰 이상의 컨텍스트 창을 지원하는 것으로 주목받았으며, 이는 단일 프롬프트로 전체 소설, 대규모 코드베이스 또는 수 시간 분량의 비디오 대본을 처리할 수 있는 양이다. AnthropicClaude (AI model family) 모델도 초기 9,000토큰 창에서 이후 출시를 통해 수십만 토큰의 컨텍스트 길이로 확장되었다.

트레이드오프와 장기 컨텍스트 한계

더 큰 컨텍스트 창이 모델이 이를 모두 잘 활용한다는 것을 보장하지는 않는다. 장기 컨텍스트 성능에 대한 연구는 반복적으로 "중간에서 길을 잃음" 효과를 발견했는데, 이는 모델이 긴 컨텍스트의 시작이나 끝 근처에 배치된 정보를 검색할 때 중간에 묻힌 정보보다 더 정확하다는 것을 보여주며, 아키텍처가 공식적으로 그러한 위치를 특권화하지 않음에도 그렇다. 특정 사실이 대량의 무관한 텍스트 안에 숨겨진 장기 컨텍스트 "바늘 찾기" 테스트는 모델의 유효 컨텍스트가 광고된 최대치와 일치하는지 측정하는 표준 방법이 되었다. 매우 긴 컨텍스트를 서비스하는 것은 계산적으로도 비용이 많이 들기 때문에, 시스템은 종종 대량의 원시 텍스트를 컨텍스트 창에 채우는 것과 Retrieval-augmented generation을 사용하여 가장 관련성 높은 구절만 선택하는 것 사이에서 실용적 선택에 직면하며, 완전성과 비용 및 원칙적으로 정확성 사이에서 절충한다.

추론과의 관계

컨텍스트 창은 또한 Chain-of-thought 프롬프팅 및 추론 모델과 같은 기법을 제약하는데, 이러한 기법은 최종 답변을 생성하기 전에 상당한 중간 텍스트를 생성한다. 길게 추론하는 모델은 그 추론으로 인해 자신의 컨텍스트 창 일부를 소비하며, 이는 이러한 기법이 널리 보급됨에 따라 더 긴 컨텍스트 창이 더 중요해진 이유 중 하나이다.

분류:large-language-models·transformers·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사