영어에서 번역됨

BLOOM-176B는 BigScience 협업에 의해 개발되고 2022년에 출시된 BLOOM 대규모 언어 모델의 1760억 파라미터 버전입니다. 이는 텍스트 생성 및 연구를 위해 설계된 다국어, 오픈 액세스 트랜스포머입니다.

BLOOM-176B는 BigScience 협력체가 개발하고 2022년 7월에 출시한 BLOOM(BigScience Large Open-science Open-access Multilingual) 언어 모델의 가장 큰 변형이다. 1760억 개의 매개변수를 가진 이 모델은 수십 개의 자연어와 프로그래밍 언어로 텍스트를 생성하도록 설계된 밀집 트랜스포머 기반 대규모 언어 모델이다. 이 모델은 1.6테라바이트 이상의 텍스트로 구성된 선별된 데이터셋인 ROOTS 코퍼스로 훈련되었으며, 유해한 응용을 방지하기 위한 사용 제한을 포함하는 개방형 라이선스인 Responsible AI License 아래 제공되었다.

BLOOM-176B는 투명성과 재현성을 강조하며 독점 모델에 대한 대규모 다국어 대안을 제공하기 위해 만들어졌다. 그 아키텍처는 표준 디코더 전용 트랜스포머를 따르며 멀티 헤드 어텐션, 층 정규화, 위치 인코딩을 포함하지만, 더 긴 시퀀스로의 외삽을 개선하는 ALiBi(Attention with Linear Biases) 위치 인코딩 방식과 같은 몇 가지 혁신을 통합한다. 이 모델은 46개의 자연어와 13개의 프로그래밍 언어를 지원하여 당시 가장 언어적으로 다양한 대규모 모델 중 하나가 되었다.

훈련 및 컴퓨팅

BLOOM-176B를 훈련하려면 상당한 컴퓨팅 자원이 필요했다. 이 모델은 프랑스의 Jean Zay 슈퍼컴퓨터에서 각각 80GB 메모리를 가진 384개의 NVIDIA A100 GPU를 사용하여 훈련되었다. 훈련 과정은 약 3.5개월이 걸렸으며 약 1,082,990 컴퓨팅 시간을 소비했다. 팀은 아담 옵티마이저와 워밍업 단계 및 코사인 감쇠를 포함한 학습률 스케줄을 포함한 딥러닝 최적화 기법의 혼합을 사용했다. 그래디언트 클리핑은 훈련을 안정화하기 위해 적용되었고, bfloat16 혼합 정밀도는 메모리 사용량을 줄이는 데 사용되었다.

훈련 데이터인 ROOTS는 BigScience 커뮤니티가 조합했으며, 책, 뉴스 기사, 웹 콘텐츠를 포함한 다양한 출처의 1.6테라바이트 텍스트로 구성되었다. 데이터셋은 품질을 보장하고 편향을 줄이기 위해 필터링 및 중복 제거되었다. 모델은 2048 토큰의 컨텍스트 길이로 훈련되었으며, ALiBi 메커니즘은 추가 훈련 없이 추론 시 더 긴 시퀀스를 처리할 수 있게 했다.

기능 및 성능

BLOOM-176B는 지원되는 언어 전반에 걸쳐 텍스트 생성, 번역, 요약에 뛰어나다. 이 모델은 다른 대규모 모델과 유사한 강력한 퓨샷 학습 능력을 보여주며, 질문 응답 및 코드 생성과 같은 작업을 수행할 수 있다. 평가에서 SuperGLUE 및 다국어 작업과 같은 벤치마크에서 경쟁력 있는 결과를 달성했지만, 다국어 초점 때문에 영어 전용 작업에서는 GPT-3와 같은 모델에 때때로 뒤처졌다.

주목할 만한 특징 중 하나는 다른 모델에서 종종 과소 대표되는 아프리카 및 동남아시아 지역의 저자원 언어로 텍스트를 생성할 수 있는 능력이다. 이 모델은 또한 Python, Java, C++와 같은 프로그래밍 언어를 지원하여 코드 완성 및 생성을 가능하게 한다. 그러나 모든 생성형 AI 모델과 마찬가지로 편향되거나 사실적으로 부정확한 출력을 생성할 수 있으며, 라이선스에는 고위험 영역에서의 사용 제한이 포함된다.

출시 및 접근

BLOOM-176B는 2022년 7월 Hugging Face Hub를 통해 출시되었으며 가중치를 다운로드할 수 있다. 출시에는 훈련 과정과 의도된 용도를 문서화한 상세한 모델 카드와 기술 보고서가 함께 제공되었다. 이 모델은 고급 하드웨어에서 실행할 수 있지만, 그 크기 때문에 여러 GPU 또는 대용량 메모리를 가진 아마존 웹 서비스 인스턴스가 필요하다. BigScience 협력체는 또한 덜 강력한 하드웨어에서 연구를 용이하게 하기 위해 BLOOM-7B 및 BLOOM-3B를 포함한 더 작은 버전도 출시했다.

BLOOM-176B의 개방형 접근성은 연구자와 개발자, 특히 학계와 독점 모델에 대한 접근이 제한된 지역의 사람들에게 귀중한 자원이 되었다. 이 모델은 편향, 해석 가능성, 다국어 NLP에 관한 연구에 사용되었으며, 더 넓은 인공지능 연구 분야에 기여했다.

영향 및 유산

BLOOM-176B는 대규모 언어 모델이 기업 자원에 의존하지 않고 협력적이고 투명하게 개발될 수 있음을 보여주었다. 그 출시는 유사한 라이선스 및 투명성 원칙을 채택한 Falcon 및 Llama 모델과 같은 이후의 오픈소스 노력에 영향을 미쳤다. 이 모델은 또한 머신러닝에서 다국어 표현의 중요성을 강조하여 다른 프로젝트가 언어적 다양성을 우선시하도록 장려했다.

성공에도 불구하고 BLOOM-176B는 추론 비용이 높고 특정 작업에 대한 미세 조정이 어렵다는 문제에 직면했다. 2025년 현재, 이 모델은 개방형 접근 모델의 기준점으로 남아 있지만, 더 새로운 모델이 성능과 효율성에서 이를 능가했다. 그 유산은 커뮤니티 주도 AI 개발이 윤리적 지침을 준수하면서 최첨단 결과를 생산할 수 있음을 증명한 데 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·multilingual·open-access·transformer
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사