GPT-5 및 아스트라 출시

영어에서 번역됨

GPT-5는 OpenAI의 멀티모달 대규모 언어 모델로, 2025년 8월 7일에 출시되어 빠른 모델과 추론 모델을 통해 실시간 AI를 발전시켰다. Google의 Astra(Gemini Live)도 2025년에 출시되어 멀티모달 AI 분야에서 경쟁하고 있다.

GPT-5는 OpenAI가 개발한 멀티모달 대규모 언어 모델로, 생성형 사전 학습 트랜스포머(GPT) 기반 모델 시리즈 중 다섯 번째 모델이다. 이 시리즈의 이전 모델인 GPT-4에 이어 2025년 8월 7일에 출시되었다. 챗봇 제품인 ChatGPT와 Microsoft Copilot 사용자뿐만 아니라 OpenAI API를 통한 개발자에게도 공개적으로 접근 가능하다. 이번 출시는 실시간 멀티모달 이해와 에이전트 기능에 초점을 맞춘 생성형 AI의 진화에 있어 중요한 진전을 의미했다.

같은 해, Google DeepMind는 Astra(또는 Gemini Live)를 출시했는데, 이는 소비자 및 기업 시장에서 GPT-5와 직접 경쟁하는 실시간 멀티모달 AI 어시스턴트이다. 2025년에 이루어진 Astra의 출시는 시각 및 청각 입력과의 원활한 상호작용을 강조하며 OpenAI의 제품에 대한 주요 경쟁자로 자리 잡았다. 이 문서는 주로 GPT-5에 초점을 맞추며, 더 넓은 환경과 관련된 부분에서 Astra를 언급한다.

배경

2023년 4월 14일, OpenAI의 최고 경영자인 Sam Altman은 매사추세츠 공과대학에서 열린 행사에서 연설하며 당시 회사가 GPT-5를 학습시키고 있지 않다고 말했다. 그는 OpenAI가 "GPT-4 개발을 우선시하고 있다"며 "우리는 GPT-5를 출시하지 않을 것이며, 당분간 출시하지 않을 것"이라고 밝혔다. 7월 18일, OpenAI는 미국에서 "GPT-5" 상표를 출원했다. 11월 13일, Altman은 Financial Times에 회사가 GPT-5 개발을 위해 노력 중임을 확인했다.

The Information에 따르면, "2024년 하반기 대부분 동안 OpenAI는 내부적으로 Orion으로 알려진 모델을 개발 중이었으며 GPT-5가 되는 것을 목표로 했다", "하지만 Orion 프로젝트는 더 나은 모델을 만들어내지 못했고, 회사는 대신 2025년 2월에 이를 GPT-4.5로 출시했다." 2025년 7월 말까지, OpenAI가 8월 초에 GPT-5를 출시할 계획이라는 예상이 널리 퍼졌다. 7월 30일, The Verge는 "Microsoft가 GPT-5를 준비하고 있다"고 보도했는데, "Microsoft의 AI 계획에 정통한 소식통"이 편집자에게 회사가 Copilot 챗봇에 대해 "작업에 따라 깊이 생각하거나 빠르게 생각하는" 모델을 제공하는 새로운 모드를 테스트 중이라고 말했다. 8월 5일, GPT-5 출시를 앞두고 OpenAI는 추론 기능을 갖춘 두 개의 오픈 가중치 모델 세트인 GPT-OSS를 출시했다. GPT-5는 이후 8월 7일 라이브스트림 이벤트에서 공개되었다.

기능

출시 당시 GPT-5는 수학, 프로그래밍, 금융, 멀티모달 이해를 테스트하는 벤치마크에서 최첨단 성능을 보였다. OpenAI에 따르면, 이전 모델 대비 개선된 점으로는 더 빠른 응답 시간, 더 나은 코딩 및 작문 능력, 건강 관련 질문에 대한 더 정확한 답변, 그리고 더 낮은 수준의 환각이 포함된다. 또한, 이전 모델과 비교하여 GPT-5는 잠재적으로 유해한 질문에 대해 완전히 거절하기보다는 안전하고 높은 수준의 응답을 제공하는 것을 목표로 하며, OpenAI는 이를 "안전한 완료"라고 부른다. 이는 "GPT-5가 더 많은 안전하지 않은 질문을 거절하면서도 무해한 정보를 찾는 사용자에게는 더 적은 거절을 제공할 수 있게" 하는 것을 목표로 한다. 또한, GPT-5는 이전 모델에 비해 더 비판적이고 "덜 과도하게 동의하는" 답변을 제공하도록 학습되었다.

GPT-5 출시 며칠 전, 모델의 초기 테스터 두 명은 코딩 및 수학·과학 문제 해결 능력에 "감명받았다"고 밝혔다. 그들은 이 모델이 GPT-4에서 큰 개선을 보여주지만, GPT-3에서 GPT-4로의 향상만큼 큰 향상은 아니라고 제안했다. GPT-5 출시 하루 전, 언론 브리핑에서 OpenAI의 최고 경영자인 Sam Altman은 GPT-5를 "AGI로 가는 길의 중요한 단계"라고 불렀으며, 이는 인간이 수행할 수 있는 모든 경제적으로 가치 있는 작업을 수행할 수 있는 능력으로 OpenAI가 정의하는 가상의 지능 수준인 인공 일반 지능을 의미한다. Altman에 따르면, GPT-5는 이전 모델보다 "상당히 우수"하며 다양한 작업에서 "박사 수준"의 능력을 제공한다.

GPT-5 사용의 정확한 에너지 소비량은 OpenAI에 의해 공개되지 않았다. 로드아일랜드 대학의 연구자들은 중간 길이의 응답이 약 18와트시를 소비하며, 이는 백열전구를 18분 동안 사용하는 것과 동일하다고 추정했다.

아키텍처

GPT-5는 빠른 고처리량 모델, 더 깊은 추론 모델, 그리고 대화 유형, 복잡성, 도구 요구 사항, 명시적 사용자 의도에 따라 어떤 모델을 사용할지 결정하는 실시간 라우터를 포함하는 시스템이다. Altman은 이전에 수동 모델 선택기가 지나치게 복잡하다고 비판하며 통합의 필요성을 제안한 바 있다. GPT-5는 또한 작업과 관련된 소스를 자율적으로 검색하기 위해 자체 데스크톱을 설정하고 브라우저를 사용할 수 있는 에이전트 기능을 포함한다. GPT-5 시스템 카드는 두 개의 빠른 고처리량 모델(gpt-5-main 및 gpt-5-main-mini)과 두 개의 추론 모델(gpt-5-thinking 및 gpt-5-thinking-mini)을 정의한다. OpenAI API에서 개발자는 추론 모델, 미니 버전, 그리고 추론 모델의 더 작고 빠른 나노 버전인 gpt-5-thinking-nano에 접근할 수 있다. API를 통해 접근 가능한 GPT-5 버전은 조정 가능한 추론 노력(낮음, 중간, 높음 또는 최소)과 장황함(낮음, 중간 또는 높음)을 갖는다. 또한, ChatGPT는 병렬 테스트 시간 계산을 사용하는 설정인 gpt-5-thinking-pro로 지칭되는 gpt-5-thinking에 대한 접근을 제공한다.

안전 및 한계

보안 연구 회사인 Neuraltrust는 GPT-5를 테스트한 첫날 내에 성공적으로 손상시켰다고 주장했다. 보고서에 따르면, GPT-5가 폭발 장치 제조에 대한 상세한 지침을 생성하도록 했다. 다른 회사인 SPLX도 유사한 테스트를 수행했으며 GPT-5의 보안에 대해 유사한 결론에 도달했다. 그들의 평가는 GPT-5가 상당한 보안 공백을 가지고 있어 기업 환경에서 사용하기에 안전하지 않을 수 있음을 시사한다.

이러한 우려에도 불구하고, OpenAI는 "안전한 완성" 접근 방식과 인간 피드백 기반 강화 학습과 같은 정렬 기법을 포함한 안전 조치를 강조해 왔다. 그러나 외부 연구자들이 지적한 보안 취약점은 고급 AI 시스템에 대한 견고한 안전을 보장하는 데 있어 지속적인 과제가 있음을 시사한다.

훈련

AIMultiple에 따르면, GPT-5는 본래 다중 모달(multimodal)이며, 이는 이미 훈련된 언어 또는 비전 모델에 의존하지 않고 텍스트와 이미지 같은 여러 양식을 한 번에 처음부터 훈련되었음을 의미한다. 훈련 과정은 비지도 사전 훈련, 지도 미세 조정, 인간 피드백 기반 강화 학습의 세 단계로 구성되었다. 사전 훈련은 책, 기사, 웹 페이지, 학술 논문 및 라이선스 출처로 구성된 대규모 다국어 데이터 세트를 사용했다. GPT-5의 시각 및 텍스트 기능은 GPT-4와 달리 훈련 전반에 걸쳐 서로 함께 개발된 것으로 설명되었다.

훈련 과정은 트랜스포머 아키텍처대규모 언어 모델 기법의 발전을 활용했으며, 여기에는 멀티 헤드 어텐션위치 인코딩이 포함된다. 데이터 증강모델 가지치기의 사용 또한 모델의 효율성과 성능에 기여했다.

사용 및 통합

GPT-5는 ChatGPT에서 사용된다. GPT-5는 모든 ChatGPT 사용자에게 무료이지만, Plus 사용자는 더 높은 사용 한도를 얻고 Pro 사용자는 GPT-5에 대한 무제한 액세스와 함께 GPT-5 Pro에 대한 제한된 액세스를 얻는다. 하위 등급 사용자에 대한 시간당 응답 수의 표준 한도는 여전히 적용된다. 또한, GPT-5의 도입과 함께 ChatGPT의 "고급 음성 모드"는 "ChatGPT 음성"으로 대체되었으며, 이는 더 자연스러운 대화를 가능하게 하는 것으로 여겨진다. OpenAI는 "표준 음성 모드는 2025년 9월 9일에 종료되어 모든 사용자를 ChatGPT 음성으로 통합한다"고 밝혔다. 2025년 11월 24일, 쇼핑 연구 기능이 ChatGPT에 추가되었으며, 이는 gpt-5-thinking-mini로 사후 훈련된 미니 모델이라고 주장된다.

GPT-5는 또한 Microsoft Copilot에서 사용할 수 있으며, Microsoft는 GPT-5를 다양한 제품에 통합할 것이라고 밝혔다. 9to5Mac에 따르면, Apple Inc.는 이 모델을 iOS 26, iPadOS 26 및 macOS Tahoe 운영 체제의 Apple Intelligence 기능에 통합할 계획이다. 또한 OpenAI API를 통해 접근할 수 있어 개발자가 모델 위에 애플리케이션을 구축할 수 있다.

비교적으로, Google의 Astra(Gemini Live)는 Android 및 Google Assistant를 포함한 Google 생태계에 통합되어 있으며, 유사한 실시간 다중 모달 기능을 제공한다. OpenAI와 Google DeepMind 간의 경쟁은 AI 어시스턴트가 할 수 있는 것의 경계를 넓히며 혁신을 가속화했다.

영향 및 평가

GPT-5의 출시는 AI 산업에 상당한 영향을 미쳤다. 벤치마크에서의 최첨단 성능은 인공지능 시스템에 대한 새로운 기준을 세웠다. 여러 도메인에 걸쳐 복잡한 작업을 처리하는 모델의 능력은 초기 테스터들로부터 칭찬을 받았지만, 일부는 GPT-4에 비해 개선이 GPT-3에서 GPT-4로의 도약만큼 극적이지 않다고 지적했다.

비평가들은 특히 Neuraltrust와 SPLX가 보고한 취약점을 고려하여 GPT-5의 안전과 보안에 대한 우려를 제기했다. 이러한 문제는 Joshua TenenbaumMelanie Mitchell과 같은 전문가가 포함된 AI 안전 및 정렬 연구의 지속적인 필요성을 강조한다.

이러한 과제에도 불구하고, GPT-5는 교육, 의료 및 소프트웨어 개발을 포함한 다양한 분야에서 AI의 광범위한 채택을 주도할 것으로 예상된다. Microsoft Copilot 및 Apple Intelligence와 같은 제품에의 통합은 소비자와 기업 모두에게 보편적인 도구가 될 것임을 시사한다.

결론

GPT-5는 생성형 AI대규모 언어 모델 개발에 있어 주요 이정표를 나타낸다. 2025년 8월 7일 Google의 Astra와 함께 출시된 것은 실시간 다중 모달 AI 어시스턴트의 새로운 시대를 표시한다. 안전 및 에너지 소비 측면에서 과제가 남아 있지만, GPT-5의 기능은 이 분야에서 이루어지고 있는 빠른 진전을 보여준다. AI가 계속 진화함에 따라, GPT-5와 같은 모델은 기술과 사회의 미래를 형성하는 데 중심적인 역할을 할 가능성이 높다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·large-language-model·openai·google-deepmind
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사