Claude 3 Haiku는 Anthropic이 개발한 Large language model로, 2024년 3월에 Claude 3 제품군 중 가장 작고 빠른 모델로 출시되었다. 고객 서비스, 콘텐츠 조정, 실시간 데이터 처리와 같이 빠른 응답이 필요한 애플리케이션을 위해 설계되었으며, 성능과 비용 효율성의 균형을 유지한다. 이 모델은 Anthropic의 API를 통해 접근할 수 있으며, Claude 소비자 애플리케이션의 기능(Claude 챗봇의 무료 티어 포함)을 지원한다.
Claude 3 Haiku는 형제 모델인 Claude 3 Opus 및 Claude 3 Sonnet과 동일한 기본 Transformer (architecture) 아키텍처를 기반으로 하지만, 매개변수 수를 줄이고 추론 파이프라인을 최적화했다. 이를 통해 훨씬 낮은 지연 시간을 달성하며, 짧은 쿼리의 경우 일반적으로 1초 미만의 응답 시간을 제공하여 대화형 및 임베디드 사용 사례에 적합하다. Anthropic은 Haiku를 최대 추론 깊이보다 속도가 우선시되는 시나리오에서 Claude 2.1과 같은 이전 모델의 대체재로 포지셔닝한다.
아키텍처 및 훈련
이 모델은 Multi-Head Attention 메커니즘을 갖춘 밀집 Neural network을 사용하며, 지도 학습과 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)의 조합으로 훈련되었다. Anthropic은 정확한 매개변수 수를 공개하지 않았지만, 독립적인 벤치마크에 따르면 Claude 3 Sonnet보다 훨씬 작으며, 약 200억~300억 개의 매개변수 범위일 것으로 추정된다. 훈련 데이터에는 공개 웹 텍스트, 라이선스 데이터 세트, 더 큰 모델이 생성한 합성 데이터가 혼합되어 있으며, 2024년 초에 데이터가 차단되었다.
Haiku는 다른 Claude 3 모델과 동일한 200,000 토큰의 컨텍스트 창을 사용하며, 출력 제어를 위해 Top-P (Nucleus) Sampling 및 Temperature Scaling을 지원한다. 또한 훈련 중 안정성과 일반화를 개선하기 위해 Layer Normalization 및 Dropout을 통합한다. 이 모델은 엣지 디바이스의 메모리 사용량을 줄이기 위해 Model Pruning에 최적화되어 있지만, 주로 클라우드 인프라에서 실행된다.
성능 및 벤치마크
공개 Artificial intelligence 리더보드에서 Claude 3 Haiku는 OpenAI의 GPT-3.5 Turbo와 같은 유사한 크기의 모델과 경쟁력 있는 성능을 보이면서 더 빠른 추론을 제공한다. MMLU(Massive Multitask Language Understanding) 벤치마크에서 Haiku는 약 75.2%를 기록했으며, Claude 3 Sonnet은 79.0%, Opus는 86.8%를 기록했다. HellaSwag 상식 추론 테스트에서는 85.9%를 달성했고, 코드 생성용 HumanEval에서는 pass@1 기준 73.0%에 도달했다. 이러한 수치는 비슷한 크기의 오픈 가중치 모델 대부분보다 높지만, Anthropic 및 OpenAI의 플래그십 모델보다는 낮다.
독립적인 테스트의 지연 시간 측정 결과, 100토큰 프롬프트에 대한 평균 첫 토큰 시간은 0.4초로, Sonnet보다 약 3배 빠르다.这使得 Haiku는 대화형 에이전트와 실시간 번역 서비스에 특히 효과적이다. 그러나 복잡한 수학적 추론 및 다단계 계획 작업에서의 성능은 눈에 띄게 약하며, GSM8K 벤치마크에서 58.3%의 정확도를 보여 깊은 논리적 추론의 한계를 나타낸다.
배포 및 가용성
Claude 3 Haiku는 Amazon Web Services(AWS)의 Amazon Bedrock 및 Google Cloud Vertex AI를 통해 Anthropic의 API로 제공되며, 엔터프라이즈 고객을 위해 Microsoft Azure를 통해서도 제공된다. 이 모델은 또한 Anthropic 자체 Claude.ai 플랫폼에 통합되어 무료 티어 사용자의 기본 모델로 사용된다. 가격은 입력 토큰 100만 개당 0.25달러, 출력 토큰 100만 개당 1.25달러로 설정되어 있어, 해당 클래스에서 가장 비용 효율적인 모델 중 하나이다.
클라우드 배포 외에도 Anthropic은 Groq와 협력하여 Groq의 맞춤형 추론 하드웨어에서 Haiku를 제공하며, 이를 통해 높은 처리량 애플리케이션의 지연 시간을 더욱 줄인다. 이 모델은 또한 온프레미스 배포를 위해 SambaNova 플랫폼을 통해 제공된다. 2024년 말 기준으로 Haiku는 자동 이메일 초안 작성, 코드 완성, 사용자 생성 콘텐츠 조정과 같은 사용 사례를 위해 여러 Generative AI 스타트업에서 채택되었다.
한계 및 안전성
다른 Claude 모델과 마찬가지로 Haiku는 헌법적 AI 기술과 인간 피드백의 조합을 사용하여 무해성과 안전하지 않은 요청 거부에 중점을 두고 훈련되었다. 그러나 크기가 더 작기 때문에 Opus에 비해 탈옥 시도에 더 취약하다. Anthropic은 알려진 실패 모드를 문서화한 상세한 모델 카드를 공개했으며, 여기에는 틈새 주제에 대한 가끔의 사실적 오류와 민감한 주제에 대한 무해한 질문을 과도하게 거부하는 경향이 포함된다.
Haiku는 Claude 3 Opus 및 Sonnet과 달리 이미지 입력을 지원하지 않으며, 이는 시각적 추론 작업에서의 사용을 제한한다. 또한 모델의 지식 차단 날짜는 2024년 1월이므로, 외부 검색 증강 없이는 그 이후의 사건에 대한 정보를 제공할 수 없다.
이전 모델과의 비교
Claude 3 Haiku는 Anthropic의 이전 컴팩트 모델인 Claude 2.1의 직접적인 후속 모델이다. Claude 2.1과 비교하여 Haiku는 지연 시간을 50% 줄이고 표준 벤치마크에서 20% 개선했으며, 동일한 컨텍스트 창을 유지한다. 이전 Encoder-Decoder Architecture 아키텍처에서 순수 디코더 전용 설계로의 전환은 이러한 개선에 기여했다. Anthropic은 또한 Haiku가 이전 모델의 일반적인 약점인 형식 지정 지침을 따르는 데 더 신뢰할 수 있다고 밝혔다.
이 모델의 출시는 시장을 세분화하려는 더 넓은 전략의 일부였으며, Opus는 고위험 추론, Sonnet은 균형 잡힌 성능, Haiku는 비용에 민감한 대량 애플리케이션을 대상으로 한다. 이는 OpenAI의 GPT-3.5 및 GPT-4 라인업과 유사한 계층화를 반영하지만, Anthropic은 Haiku의 우수한 속도 대비 비용 비율을 강조한다.
향후 방향
Anthropic은 Claude 3 Haiku의 특정 후속 모델을 발표하지 않았지만, 회사의 연구 로드맵에 따르면 향후 컴팩트 모델은 더 효율적인 어텐션 메커니즘과 멀티모달 입력을 위한 Cross-Attention을 통합할 가능성이 있다. Haiku의 성공은 하드웨어 공급업체에도 영향을 미쳤으며, AMD 및 Intel은 모델의 추론 패턴에 맞춰 가속기를 최적화하고 있다. 2025년 초 현재 Haiku는 프로덕션 환경에서 속도와 성능의 균형을 원하는 개발자에게 여전히 인기 있는 선택이다.