테스트-시간 연산은 모델이 답변을 생성하는 동안 수행하는 연산량을 의미하며, 훈련 중에 소비되는 연산과는 구별된다. 딥러닝 시대의 대부분 동안 성능 향상은 거의 전적으로 훈련 확장에서 비롯되었다. 더 많은 매개변수, 더 많은 데이터, 더 많은 훈련 연산이 그것이며, 이는 Scaling laws에 설명되어 있다. 테스트-시간 연산은 추론 자체를 두 번째 수단으로 취급한다. 모델이 더 오래 생각하거나, 더 많은 후보 답변을 탐색하거나, 응답을 반환하기 전에 자신의 작업을 검토하도록 만들 수 있으며, 이러한 각각은 훈련 시점이 아닌 사용 시점에 추가 연산을 소비한다.
이 접근 방식은 2024년 9월 OpenAI가 출시한 OpenAI o1과 함께 주류로 진입했다. 빠르게 단일 패스로 답변하도록 조정된 초기 챗봇과 달리, o1은 최종 답변을 생성하기 전에 확장된, 대부분 숨겨진 내부 추론 체인을 생성하도록 훈련되었으며, 수학, 코딩, 논리 벤치마크에서의 정확도는 더 많은 추론 토큰이 허용됨에 따라 측정 가능하게 향상되었다. 이는 Reasoning model을 Large language model의 별도 범주로 확립했으며, DeepSeek-R1과 Google의 Gemini "Thinking" 변형을 포함한 경쟁사들이 약 1년 안에 뒤를 따랐다.
메커니즘
테스트-시간 연산은 여러 방식으로 사용될 수 있다. 가장 간단한 것은 더 긴 Chain-of-thought 생성이다. 모델은 답변을 확정하기 전에 중간 추론 단계를 텍스트 토큰으로 작성하며, 더 많은 토큰을 허용하면 산술이나 코드 정확성과 같이 명확한 정답이 있는 작업에서 일반적으로 성능이 향상된다. 두 번째 기법 계열은 여러 독립적인 답변을 샘플링하고 최상의 것을 선택하는데, 다수결 투표(자기 일관성) 또는 별도의 검증기나 보상 모델로 후보를 점수화하는 방식이며, 때로는 부분 해결책에 대한 트리 탐색으로 구성된다. 세 번째 접근 방식은 수정이다. 모델이 초안을 생성하고, 이를 비판하고, 재생성하여 첫 번째 출력에 고정하지 않고 오류를 잡기 위해 추가 패스를 소비한다.
이러한 방법은 이전에 있던 In-context learning 및 프롬프트 기법과 주로 추가 연산을 누가 제어하는지에서 다르다. Few-shot learning 예제와 같은 프롬프트 기법은 모델이 기존 가중치를 더 효과적으로 사용하도록 요청한다. 테스트-시간 연산 방법, 특히 검증 가능한 보상으로 Reinforcement learning으로 훈련된 모델에서는 모델 자체가 주어진 문제에 필요한 내부 숙고의 양을 결정하게 하며, 원칙적으로 쉬운 질문에는 적은 연산을, 어려운 질문에는 훨씬 더 많은 연산을 소비한다.
경제성과 절충
추론 모델은 표준 채팅 모델보다 답변당 훨씬 더 많은 토큰을 소비할 수 있기 때문에, 테스트-시간 연산은 사전 훈련 규모가 대부분 한쪽으로 밀어낸 비용 및 지연 시간 절충을 다시 도입한다. 연구소와 사용자는 이제 더 많은 사고에 비용을 지불함으로써 추론 시점에 정확도를 직접 구매할 수 있다. 이는 제품 설계에 실질적인 영향을 미친다. 추론 모델 기반의 코딩 에이전트나 연구 어시스턴트는 어려운 질문에 답하는 데 수십 초 또는 수 분이 걸릴 수 있으며, 이러한 모델의 API 가격은 일반적으로 출력 길이와 토큰당 프리미엄을 모두 반영한다.
반응과 공개 질문
연구자들은 테스트-시간 연산이 진정한 추론과 관련이 있는지, 아니면 더 비싼 패턴 매칭의 한 형태인지에 대해 논쟁해 왔으며, ARC-AGI와 같은 벤치마크의 결과는 양측 주장에 모두 사용되었다. 추론 모델은 이전 세대보다 점수를 상당히 향상시켰지만, 훈련 데이터에 잘 표현되지 않은 추론 패턴이 필요한 문제에서는 성능이 여전히 저하된다. 일부 연구소는 테스트-시간 연산 확장을 원래 스케일링 법칙과 비교할 만한 새로운 축으로 설명하며, 추가적인 이득은 순수히 더 긴 사고 체인이 아니라 더 효율적인 탐색과 검증에서 나올 것이라고 기대한다. 다른 이들은 추가 추론 연산의 이득이 어느 지점을 넘으면 수익이 감소하며, 이 기법은 사전 훈련 규모와 Fine-tuning을 대체하는 것이 아니라 보완하는 것으로 이해하는 것이 가장 좋다고 지적한다. 2025년까지 테스트-시간 연산은 "더 오래 생각하기"로 인한 문제별 정확도 향상이 연구소에 매개변수 수와는 별개의, 쉽게 마케팅할 수 있는 능력 다이얼을 제공했기 때문에 Artificial general intelligence 타임라인에 대한 경쟁적 주장의 중심이 되었다.