영어에서 번역됨

2024년 OpenAI가 출시한 추론 중심의 대규모 언어 모델로, 답변을 생성하기 전에 추론 시점에서 확장된 숨은 사고 사슬 추론을 사용한 최초의 널리 배포된 모델이다.

OpenAI o1은 OpenAI가 개발한 Reasoning model로, 2024년 9월에 미리보기 형태로 출시되었고, 2024년 12월에 정식 출시되었다. 이는 이전의 GPT-4 계열과 차별화된 접근으로, 경쟁 수학, 코딩, 과학적 문제 해결과 같은 다단계 추론 작업에 명시적으로 최적화된 훈련 및 추론 방식을 도입했으며, 단순히 일반 목적의 규모 확장만을 추구하지 않았다.

확장된 사고 사슬

OpenAI에 따르면, o1의 핵심 기술 혁신은 최종 답변을 생성하기 전에 확장된 내부 Chain-of-thought을 생성하도록 모델을 훈련하고, Reinforcement learning을 사용하여 중간 추론 과정의 품질을 개선한 것이었다. 사용자 제공 지침을 통해 사고 사슬 추론을 유도한 초기 프롬프트 기법과 달리, o1은 이 추론을 자동으로 수행하고 더 어려운 문제에 더 많은 계산을 할당하도록 훈련되었으며, 이는 Test-time compute 확장으로 알려지게 되었다. 즉, 모델이나 훈련 데이터 크기만 늘리는 대신, 모델이 추론 시간에 더 오래 "생각"하도록 함으로써 능력을 향상시킬 수 있었다. OpenAI는 기술이 복제될 경쟁적 우려와 원시 사고 사슬에 필터링되지 않거나 조작적인 콘텐츠가 포함될 안전성 우려를 이유로, 모델의 원시 내부 추론 과정을 사용자에게 의도적으로 숨기고 요약된 버전만 표시했다.

성능 및 벤치마크

OpenAI는 추론 중심 평가에서 GPT-4급 모델 대비 o1의 상당한 성능 향상을 보고했으며, 경쟁 수학 문제와 SWE-bench 소프트웨어 엔지니어링 벤치마크에서 큰 개선을 보였고, 박사 수준 과학 질문에서도 강력한 성능을 나타냈다. 모델의 개선은 확장되고 검증 가능한 다단계 논리가 필요한 작업에서 가장 두드러졌으며, 더 개방적이거나 지식 회상 작업에서의 개선은 상대적으로 미미했다. 이는 지식 용량과 추론 능력 사이의 성장하는 구분을 강화하는 패턴이었다.

산업 영향

o1의 출시는 업계 전반에 걸쳐 빠른 대응을 촉발했으며, DeepSeek를 포함한 경쟁 연구소들이 자체 추론 중심 모델을 출시했다. 가장 주목할 만한 것은 2025년 1월의 DeepSeek-R1로, 극적으로 낮은 보고된 훈련 비용으로 비교 가능한 추론 벤치마크 성능을 달성했고, o1과 달리 전체 사고 사슬 추론 과정과 오픈 가중치를 공개했다. 이러한 대비는 OpenAI가 추론 과정을 숨기기로 한 결정의 가치에 대한 논쟁을 심화시켰고, 최첨단 AI에서의 Open-weights models 경쟁에 대한 더 넓은 논의에 기여했다. o1은 프리트레이닝 규모와 함께 테스트 시간 계산 확장을 별개의 지속 가능한 패러다임으로 확립했으며, OpenAI와 경쟁사들은 이후 동일한 기본 접근 방식을 기반으로 한 추가 추론 모델 반복을 출시했다.

분류:generative-ai·reasoning·openai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사