OPT(광학적 투과율)

영어에서 번역됨

OPT(Open Pre-trained Transformer)는 Meta AI가 개발한 디코더 전용 언어 모델 제품군으로, 2022년 5월에 출시되었습니다. 이 모델들은 1억 2,500만 개에서 1,750억 개의 파라미터 범위를 가지며, 가중치, 코드, 훈련 로그를 포함한 완전한 오픈소스 제공으로 주목받고 있습니다.

OPT(Open Pre-trained Transformer)는 Meta AI가 개발하고 2022년 5월에 공개한 디코더 전용 대규모 언어 모델 계열이다. 이 제품군은 1억 2,500만 개에서 1,750억 개까지의 매개변수 크기를 포괄하며, 가장 큰 모델인 OPT-175B는 GPT-3의 규모와 맞먹는다. 당시의 많은 모델과 달리 OPT는 가중치, 학습 코드, 상세한 로그를 공개하여 대규모 언어 모델 연구에 대한 접근성을 높이는 것을 목표로 했다.

OPT의 아키텍처는 표준 Transformer (architecture) 디코더 설계를 따르며, 레이어 정규화 및 잔차 연결과 같은 개선 사항을 통합한다. 모델은 Common Crawl, 위키백과, BooksCorpus와 같은 출처를 포함한 1,800억 개의 토큰으로 구성된 다양한 말뭉치로 학습되었다. 학습 과정은 동적 손실 스케일링 및 그래디언트 클리핑과 같은 기법을 사용하여 계산 효율성과 안정성을 강조했다.

개발 및 공개

OPT는 Susan Zhang과 Meta AI의 동료들이 작성한 "OPT: Open Pre-trained Transformer Language Models"라는 논문에서 소개되었다. 공개에는 모델 가중치뿐만 아니라 학습 코드와 학습 과정의 상세한 로그도 포함되었으며, 이는 이러한 규모의 모델에서는 전례가 없는 일이었다. 목표는 인공지능 연구 커뮤니티 내에서 재현성과 협업을 장려하는 것이었다.

모델은 비상업적 라이선스로 제공되었으며, 요청 절차를 통해 접근이 허용되었다. 공개에는 데모와 문서가 함께 제공되었다. 가장 큰 모델인 OPT-175B는 상당한 계산 리소스가 필요했지만, 다양한 연구 요구를 충족시키기 위해 더 작은 변형(예: 125M, 350M, 1.3B, 2.7B, 6.7B, 13B, 30B, 66B)도 제공되었다.

아키텍처 및 학습

OPT는 GPT-3와 유사한 인과적 주의 메커니즘을 갖춘 디코더 전용 아키텍처를 사용한다. 주요 설계 선택에는 사전 정규화(각 하위 레이어 전에 레이어 정규화 적용), GELU 대신 ReLU 활성화, 학습된 위치 임베딩이 포함된다. 학습 데이터는 필터링 및 중복 제거되었으며, 모델은 코사인 학습률 스케줄과 함께 Adam 최적화를 사용하여 학습되었다.

OPT-175B의 학습에는 NVIDIA A100 GPU에서 약 992 GPU-시간이 소요되었으며, 이는 최적화 기법 덕분에 유사한 모델보다 눈에 띄게 효율적이었다. 학습 로그는 손실 급증과 같은 문제와 이를 완화하기 위한 전략을 문서화했다.

성능 및 평가

OPT 모델은 SuperGLUE, SQuAD, OpenBookQA를 포함한 다양한 자연어 처리 벤치마크에서 평가되었다. OPT-175B는 많은 작업에서 GPT-3와 경쟁력 있는 성능을 보였지만, 코드 생성 작업에서 약간 낮은 성능과 같은 몇 가지 차이점을 나타냈다. 모델은 또한 퓨샷 학습 능력을 보여주었으며, 제공된 예제 수가 증가함에 따라 성능이 향상되었다.

제로샷 및 퓨샷 설정에서 OPT-175B는 질문 응답 및 상식 추론 작업에서 강력한 결과를 달성했다. 그러나 다른 대규모 모델과 마찬가지로 편향되거나 유해한 출력을 생성할 수 있었으며, 논문에서는 한계와 윤리적 고려 사항을 논의했다.

영향 및 유산

OPT는 오픈소스 AI 커뮤니티에서 획기적인 공개로, 대규모 모델 개발의 투명성에 대한 선례를 세웠다. 이는 BLOOMLLaMA와 같은 후속 오픈 모델에 영향을 미쳤다. OPT의 가용성은 연구자들이 독점 모델의 장벽 없이 모델 동작, 파인튜닝, 해석 가능성을 연구할 수 있게 했다.

공개는 또한 강력한 모델의 오픈소스화 위험(잠재적 오용 포함)에 대한 논의를 촉발했다. Meta AI는 사용 사례 정책 및 접근 제어를 포함한 책임 있는 공개 전략을 구현했다. 이러한 우려에도 불구하고 OPT는 학술 연구에서 널리 사용되는 기준 모델이자 오픈 모델 개발의 참조점으로 남아 있다.

같이 보기

참고 문헌

  • Zhang, S., et al. (2022). "OPT: Open Pre-trained Transformer Language Models." arXiv:2205.01068.
  • Meta AI. (2022). "Introducing OPT."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-models·meta-ai·open-source-ai·transformer-architecture
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사