영어에서 번역됨

OpenAI가 2019년에 단계적으로 출시한 대규모 자회귀 언어 모델로, 오용 우려로 인해 전체 가중치를 공개하지 않기로 한 OpenAI의 초기 결정이 촉발한 논란으로 유명하다.

GPT-2(Generative Pretrained Transformer 2)는 OpenAI가 개발하고 2019년 2월에 처음 발표한 Large language model이다. Transformer (architecture) 아키텍처를 기반으로 구축된 GPT-2는 약 800만 개의 웹 페이지로 구성된 데이터셋인 WebText에서 순수 자기회귀 다음 토큰 예측 목표를 사용하여 훈련되었으며, 2018년에 출시된 더 작은 원래 GPT 모델의 직접적인 후속 모델이다.

단계적 출시

GPT-2는 주로 아키텍처 때문이 아니라 OpenAI가 이를 출시한 방식으로 널리 알려지게 되었다. 전체 모델은 15억 개의 매개변수를 포함했는데, 이는 당시 공개 언어 모델로서는 비정상적으로 큰 규모였으며, 짧은 프롬프트에서 여러 문단에 걸친 일관된 텍스트를 생성하는 유창함은 많은 연구자들을 놀라게 했다. OpenAI는 가짜 뉴스 생성, 스팸, 대규모 사칭과 같은 악의적 사용에 대한 우려를 인용하면서 처음에는 전체 15억 매개변수 모델의 공개를 거부하고, 잠재적 오용을 연구하는 동안 더 작은 버전만 공개했다. 모델이 "공개하기에 너무 위험하다"는 공개적 프레이밍을 동반한 이 결정은 연구 커뮤니티 일부에서 상당한 비판을 받았으며, 과도하게 신중하거나 마케팅 전략이거나 연구 결과를 보류하는 어색한 선례를 만들었다는 주장이 제기되었다. OpenAI는 점진적으로 입장을 바꿔, 단계적 출시 연구에서 해당 규모에서 우려했던 오용에 대한 강력한 증거를 찾지 못했다고 보고한 후 2019년 11월에 전체 15억 매개변수 모델을 공개했다.

중요성

GPT-2는 작업별 Fine-tuning 없이 자연어로 된 예시를 프롬프트로 제공받는 것만으로 요약, 번역, 질문 답변을 생성하는 강력한 제로샷 작업 성능을 입증한 최초의 모델 중 하나였으며, 이는 이후 후속 모델인 GPT-3에서 Few-shot learningIn-context learning으로 공식화될 것의 초기 예시였다. 원래 GPT보다 약 10배 큰 규모는 또한 연구자들이 이후 더 공식적으로 Scaling laws로 설명하게 될 것, 즉 모델과 데이터 크기를 늘리면 언어 모델링 성능이 예측 가능하게 향상된다는 점을 뒷받침하는 초기 데이터 포인트 역할을 했다.

유산

GPT-2의 출시 전략은 AI 거버넌스 및 AI safety 논쟁에서 널리 인용되는 사례 연구가 되었으며, 이후 Llama 및 기타 Open-weights models 모델과 같은 시스템에서 다시 표면화된 공개 대 비공개 모델 출시에 대한 더 지속적인 논쟁을 예고했다. OpenAI 자체 제품 라인 내에서 GPT-2의 아키텍처와 훈련 접근 방식은 다음 해에 100배 이상의 매개변수 수로 출시된 GPT-3의 직접적인 기반을 형성했으며, 궁극적으로 2022년에 GPT 계열을 주류 관심으로 끌어올린 ChatGPT 제품으로 이어졌다. 연구자 Alec Radford와 OpenAI의 동료들은 GPT-2의 주요 저자로 인정받고 있다.

분류:generative-ai·language-models·openai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사