Sakana Fugu는 도쿄에 본사를 둔 스타트업 Sakana AI가 개발한 생성형 인공지능 모델이다. 2024년에 공개되었으며, Mixture of experts 아키텍처를 활용하여 추론 단계마다 파라미터의 일부만 활성화함으로써 효율적인 텍스트 및 이미지 생성을 위해 설계되었다. 이 모델은 진화 연산과 집단 지능의 개념을 차용한, 자연에서 영감을 얻은 알고리즘에 대한 Sakana AI의 광범위한 연구의 일부이다. 'Fugu'라는 이름은 일본 복어를 가리키며, 진미(珍味)와 모델의 컴팩트하고 효율적인 설계를 동시에 상징한다.
Sakana Fugu는 2024년 초 기술 블로그 게시물을 통해 처음 발표되었으며, 같은 해 후반에 공개 릴리스가 이루어졌다. 이 모델은 허용적인 오픈소스 라이선스로 제공되어 학술적 및 상업적 사용이 모두 가능하다. 공개적으로 이용 가능한 텍스트와 이미지로 구성된 선별된 데이터셋으로 훈련되었으며, 일본어와 영어 콘텐츠에 중점을 두어 Sakana AI의 이중 언어 연구 목표를 반영한다.
아키텍처 및 설계
이 모델은 Transformer (architecture) 기반의 신경망에 희소 Mixture of experts 레이어를 사용하며, 각 토큰 또는 이미지 패치를 소수의 전문가 모듈로 라우팅한다. 이 설계는 유사한 파라미터 수를 가진 밀집 모델과 비교하여 추론 중 계산 비용을 줄인다. Sakana Fugu는 텍스트와 이미지 모달리티 모두에 Multi-Head Attention 메커니즘을 사용하며, 각 입력 유형에 대해 별도의 인코더를 갖는다. 이미지 생성 구성 요소는 transformer 프레임워크에 맞게 조정된 U-Net 스타일 디코더를 기반으로 하며, 훈련 안정화를 위해 전체에 걸쳐 잔차 연결을 사용한다.
훈련에는 Adam (Optimizer)와 워밍업 및 코사인 감쇠를 포함하는 Learning Rate Scheduling이 사용되었다. 모델은 Deep learning 연구에서 NVIDIA 하드웨어의 지배력이 두드러지는 가운데 주목할 만한 선택인 AMD GPU 클러스터에서 훈련되었다. Sakana AI는 비용 효율성과 공급망 고려 사항을 이 결정의 이유로 언급했다.
기능 및 성능
Sakana Fugu는 일관된 텍스트 구절을 생성하고, 질문에 답변하며, 텍스트 설명에서 이미지를 생성할 수 있다. Sakana AI가 발표한 벤치마크에서 이 모델은 일본어 버전의 LLM 평가 스위트와 같은 일본어 언어 이해 작업과 FID(Fréchet Inception Distance)와 같은 이미지 생성 품질 지표에서 경쟁력 있는 점수를 달성했다. 이 모델은 텍스트에 대해 8,192 토큰의 컨텍스트 창을 지원하며 최대 1024x1024 픽셀 해상도의 이미지를 생성한다. 또한 제어된 생성을 위해 Top-P (Nucleus) Sampling 및 Temperature Scaling을 지원한다.
한 가지 독특한 특징은 단일 순방향 패스에서 다중 모달 생성을 수행할 수 있어, 별도의 미세 조정 없이 이미지 캡셔닝 및 텍스트-이미지 합성과 같은 작업을 가능하게 한다는 점이다. 모델의 효율성은 엣지 디바이스 배포에 적합하지만, 공식 문서에 따르면 전체 성능을 위해서는 최소 8GB 메모리의 GPU가 필요하다.
릴리스 및 채택
초기 릴리스에는 기본 모델과 명령어 튜닝 변형 모두에 대한 사전 훈련된 가중치가 포함되었다. 명령어 튜닝 버전은 RLHF(인간 피드백으로부터의 강화 학습)와 추가 Curriculum Learning 단계를 사용하여 정렬되었다. 릴리스 후 몇 달 만에 Sakana Fugu는 특히 일본 개발자들 사이에서 오픈소스 커뮤니티에서 주목을 받았다. 여러 로컬 AI 툴킷에 통합되었으며 효율적인 머신 러닝에 관한 학술 논문에서 참조 모델로 인용되고 있다.
2024년 말 현재 Sakana Fugu는 AI 모델 평가를 위한 크라우드소싱 데이터셋인 wikiprompt 플랫폼에서 71개의 프롬프트에 사용되어 컴팩트 생성 모델의 벤치마크로 인정받고 있음을 나타낸다. 모델의 코드와 문서는 GitHub에 호스팅되어 있으며 활발한 커뮤니티 기여가 이루어지고 있다.
비교 및 맥락
Sakana Fugu는 OpenAI의 소형 GPT 변형 및 Anthropic의 Claude Instant와 같은 다른 오픈소스 모델과 경쟁하지만, 다중 모달 효율성과 일본어 지원에 대한 명시적 초점에서 차별화된다. 종종 클라우드 기반인 Google DeepMind의 모델과 달리 Sakana Fugu는 로컬 배포를 위해 설계되었다. mixture-of-experts 접근 방식은 Google DeepMind 및 Nokia Bell Labs의 초기 연구에서 차용했지만, Sakana AI는 이를 더 작은 파라미터 수에 맞게 조정하여 개별 연구자도 접근할 수 있게 했다.
Sakana AI의 개발 팀에는 이전에 Stanford AI Lab 및 BAIR (Berkeley AI Research)에 소속되었던 연구원들이 포함되어 있으며, 회사는 Amazon Web Services의 스타트업 프로그램으로부터 자금을 지원받았다. 모델의 릴리스는 AI21 Labs 및 Inflection AI의 노력에서 볼 수 있듯이 효율적이고 오픈소스인 AI로 향하는 광범위한 추세와 일치한다.
한계 및 향후 작업
Sakana Fugu의 주요 한계는 특히 비일본어 및 비영어 언어에 대한 지식 기반이 대형 모델에 비해 작고, 복잡한 장면에 대해 덜 상세한 이미지를 생성하는 경향이 있다는 점이다. 개발자들은 문서에서 이러한 문제를 인정했으며 2025년으로 예정된 더 큰 후속 모델에 대한 계획을 개략적으로 제시했다. 향후 작업에는 텍스트와 이미지 모달리티 간의 Cross-Attention 메커니즘 개선과 추가 언어 지원 확장도 포함된다.
이러한 제약에도 불구하고 Sakana Fugu는 효율적인 Generative AI 설계의 주목할 만한 사례를 대표하며, 접근성과 자원 절약을 우선시하는 모델의 성장하는 생태계에 기여하고 있다.