영어에서 번역됨

OPT-175B는 메타가 공개한 1750억 개의 매개변수를 가진 오픈소스 대규모 언어 모델로, 2022년에 고급 AI 연구에 대한 접근성을 민주화하기 위해 출시되었다. 이 모델은 GPT-3의 규모와 맞먹으면서도 공개된 가중치와 코드를 제공하여 LLM 동작에 대한 더 폭넓은 연구를 가능하게 한다.

OPT-175B는 메타 AI가 개발한 대규모 언어 모델로, 2022년 5월에 공개되었다. 1750억 개의 매개변수를 가진 이 모델은 OpenAI의 GPT-3 규모에 맞추면서도 연구자들이 공개적으로 사용할 수 있도록 설계되었다. 이 모델의 공개에는 가중치, 코드, 훈련 로그가 포함되었으며, 이는 당시 많은 AI 연구소의 폐쇄적인 관행에서 벗어난 것이었다. 이러한 투명성은 재현 가능한 연구와 대규모 신경망에 대한 더 깊은 이해를 촉진하는 것을 목표로 했다.

OPT-175B는 트랜스포머 아키텍처, 특히 자기회귀적 디코더 전용 설계를 기반으로 한다. GPT-3와 유사한 구조를 사용하며, 96개의 레이어, 96개의 어텐션 헤드, 12,288의 은닉 차원을 갖는다. 이 모델은 약 1800억 개의 토큰으로 구성된 다양한 공개 텍스트 말뭉치로 훈련되었다. 이 데이터셋에는 책, 웹 텍스트 및 기타 출처가 포함되었으며, 저품질 또는 중복 콘텐츠를 제거하기 위해 필터링되었다. 훈련에는 992개의 80GB A100 GPU가 사용되었으며, 약 250만 GPU-시간이 소요되었는데, 이는 효율적인 병렬화 기술 덕분에 이전 모델에 비해 상당히 절감된 비용이었다.

훈련 및 최적화

OPT-175B의 훈련 과정은 그 규모를 관리하기 위해 여러 고급 기술을 사용했다. 메타는 GPU 클러스터 전반에 걸쳐 데이터, 모델, 파이프라인 병렬화를 결합했다. 또한 그래디언트 클리핑을 구현하여 훈련을 안정화하고, 워밍업 단계와 코사인 감쇠를 포함한 학습률 스케줄을 사용했다. 모델은 Adam 옵티마이저로 훈련되었으며, 배치 크기는 4백만 토큰이었다. 메모리 사용량을 줄이기 위해 혼합 정밀도 훈련을 사용하여 가중치를 FP16으로 저장하고 옵티마이저 상태에는 FP32를 사용했다. 공개된 훈련 로그는 손실 급증과 팀의 대응과 같은 문제를 기록하여 대규모 훈련 역학에 대한 드문 통찰력을 제공했다.

오픈소스 영향

OPT-175B의 공개는 대규모 언어 모델 환경에서 획기적인 사건이었다. 그 이전에는 GPT-3와 같은 이 규모의 모델은 유료 API를 통해서만 사용할 수 있어 학술 연구가 제한적이었다. 공개 가중치를 제공함으로써 메타는 연구자들이 모델을 직접 실행, 미세 조정, 탐색할 수 있게 했다. 이는 편향, 유해성, 해석 가능성과 같은 주제에 대한 일련의 연구로 이어졌다. 이 모델은 또한 BLOOM 및 LLaMA와 같은 후속 오픈 모델의 기준선 역할을 했으며, 이들은 그 교훈을 바탕으로 구축되었다. 그러나 공개적인 출시는 모델이 설득력 있는 허위 정보나 스팸을 생성할 수 있기 때문에 오용에 대한 우려도 제기했다. 메타는 연구자들이 접근을 신청하도록 요구함으로써 이 문제를 해결했지만, 가중치는 여전히 일반적인 독점 모델보다 더 접근성이 높았다.

성능 및 평가

표준 벤치마크에서 OPT-175B는 GPT-3와 비슷한 성능을 보였지만 약간의 차이가 있었다. 예를 들어, SuperGLUE 스위트에서는 유사한 점수를 달성했으며, Winograd Schema와 같은 일부 추론 작업에서는 약간의 차이를 보였다. 이 모델은 퓨샷 학습에서 뛰어나며, 몇 가지 예제만으로 새로운 작업에 적응하는 GPT-3의 능력과 일치했다. 그러나 특정 유형의 사실 회상에 어려움을 겪었고 때로는 환각 정보를 생성했다. 메타의 평가에는 인간 선호도 테스트도 포함되었으며, OPT-175B는 개방형 생성에서 GPT-3와 경쟁력이 있는 것으로 평가되었지만 일부 구조화된 작업에서는 뒤처졌다. 코드 생성 성능은 덜 견고했으며, 이는 훈련 데이터의 코드 콘텐츠가 제한적이었음을 반영한다.

한계 및 윤리적 고려 사항

다른 대규모 모델과 마찬가지로 OPT-175B는 훈련 데이터에 존재하는 편향을 나타냈다. 메타의 자체 분석에 따르면, 특히 성별, 인종, 종교와 관련하여 고정관념적이거나 공격적인 콘텐츠를 생성할 수 있었다. 이 모델은 또한 문구를 반복하는 경향이 있었고 유해한 텍스트를 생성하도록 쉽게 프롬프트될 수 있었다. 이러한 문제를 완화하기 위해 메타는 상세한 모델 카드를 제공하고 책임 있는 사용을 권장했다. 또한 더 쉬운 실험을 위해 더 작은 버전인 OPT-1.3B를 출시했다. 이렇게 강력한 모델을 오픈소스화하는 것에 대한 윤리적 논쟁은 계속되었으며, 일부는 투명성이 위험보다 중요하다고 주장하고 다른 일부는 더 통제된 접근을 요구했다. 2024년 현재 OPT-175B는 오픈 모델 개발의 기준점으로 남아 있지만, 더 새로운 모델이 그 능력을 능가했다.

유산 및 영향

OPT-175B는 대규모 모델이 치명적인 결과 없이 공개될 수 있음을 보여줌으로써 AI 연구의 방향에 영향을 미쳤다. 이는 메타의 후속 LLaMA 시리즈의 길을 열었으며, 효율성과 접근성을 더욱 개선했다. 이 모델은 또한 활성화 체크포인팅 및 텐서 병렬화와 같은 효율적인 훈련 및 추론 기술 개발에 기여했다. 공개된 훈련 로그는 확장의 실질적인 문제를 이해하는 데 귀중한 자원이 되었다. 오늘날 가장 강력한 모델은 아니지만, OPT-175B는 생성형 AI 역사에서 중요한 위치를 차지하며, 독점 시스템이 지배하던 분야에서 개방성으로의 전환을 나타낸다. 그 공개는 AI21 랩스인플렉션 AI와 같은 다른 연구소가 개방 전략을 고려하도록 장려했지만, 많은 곳은 여전히 폐쇄적 접근 방식을 선택했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·open-source-ai·meta-ai·transformer
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사