Claude 3 Haiku est un grand modèle de langage développé par Anthropic, introduit en mars 2024 comme le membre le plus petit et le plus rapide de la famille Claude 3. Il est conçu pour des applications nécessitant des réponses rapides, telles que le service client, la modération de contenu et le traitement de données en temps réel, tout en maintenant un équilibre entre performance et efficacité économique. Le modèle est accessible via l'API d'Anthropic et alimente des fonctionnalités des applications grand public Claude, y compris le niveau gratuit du chatbot Claude.
Claude 3 Haiku repose sur la même architecture Transformer (architecture) sous-jacente que ses homologues, Claude 3 Opus et Claude 3 Sonnet, mais avec un nombre de paramètres réduit et un pipeline d'inférence optimisé. Cela lui permet d'atteindre une latence nettement plus faible, avec des temps de réponse typiques inférieurs à une seconde pour les requêtes courtes, ce qui le rend adapté aux cas d'utilisation interactifs et intégrés. Anthropic positionne Haiku comme un remplaçant des modèles antérieurs comme Claude 2.1 dans les scénarios où la vitesse est prioritaire sur la profondeur maximale du raisonnement.
Architecture et entraînement
Le modèle utilise un réseau de neurones dense avec un mécanisme de attention multi-têtes, entraîné à l'aide d'une combinaison de apprentissage supervisé et de Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours d'IA). Anthropic n'a pas divulgué le nombre exact de paramètres, mais des benchmarks indépendants suggèrent qu'il est nettement plus petit que Claude 3 Sonnet, probablement dans une fourchette de 20 à 30 milliards de paramètres. Les données d'entraînement incluent un mélange de textes web publics, de jeux de données sous licence et de données synthétiques générées par des modèles plus grands, avec une date limite début 2024.
Haiku utilise une fenêtre de contexte de 200 000 jetons, comme les autres modèles Claude 3, et prend en charge Top-P (Nucleus) Sampling et Temperature Scaling pour le contrôle de la sortie. Il intègre également Layer Normalization et Dropout pendant l'entraînement pour améliorer la stabilité et la généralisation. Le modèle est optimisé pour Model Pruning afin de réduire l'empreinte mémoire sur les appareils périphériques, bien qu'il fonctionne principalement sur une infrastructure cloud.
Performance et benchmarks
Sur les classements publics en intelligence artificielle, Claude 3 Haiku se comporte de manière compétitive avec des modèles de taille similaire, tels que GPT-3.5 Turbo de OpenAI, tout en offrant une inférence plus rapide. Dans le benchmark MMLU (Massive Multitask Language Understanding), Haiku obtient environ 75,2 %, contre 79,0 % pour Claude 3 Sonnet et 86,8 % pour Opus. Sur le test de raisonnement de bon sens HellaSwag, il atteint 85,9 %, et sur HumanEval pour la génération de code, il atteint 73,0 % pass@1. Ces chiffres le placent au-dessus de la plupart des modèles à poids ouverts de taille comparable, mais en dessous des modèles phares d'Anthropic et d'OpenAI.
Les mesures de latence issues de tests indépendants montrent un temps moyen jusqu'au premier jeton de 0,4 seconde pour une invite de 100 jetons, environ trois fois plus rapide que Sonnet. Cela rend Haiku particulièrement efficace pour les agents conversationnels et les services de traduction en temps réel. Cependant, ses performances en raisonnement mathématique complexe et en planification multi-étapes sont nettement plus faibles, avec une précision de 58,3 % sur le benchmark GSM8K, indiquant des limites dans l'inférence logique profonde.
Déploiement et disponibilité
Claude 3 Haiku est disponible via l'API d'Anthropic sur Amazon Web Services (AWS) via Amazon Bedrock et sur Google Cloud Vertex AI, ainsi que via Microsoft Azure pour les clients d'entreprise. Le modèle est également intégré à la plateforme Claude.ai d'Anthropic, où il sert de modèle par défaut pour les utilisateurs du niveau gratuit. Le prix est fixé à 0,25 $ par million de jetons d'entrée et 1,25 $ par million de jetons de sortie, ce qui en fait l'un des modèles les plus rentables de sa catégorie.
En plus du déploiement cloud, Anthropic s'est associé à Groq pour proposer Haiku sur le matériel d'inférence personnalisé de Groq, ce qui réduit encore la latence pour les applications à haut débit. Le modèle est également disponible via la plateforme SambaNova pour les déploiements sur site. Depuis fin 2024, Haiku a été adopté par plusieurs startups de IA générative pour des cas d'utilisation tels que la rédaction automatique d'e-mails, la complétion de code et la modération de contenu généré par les utilisateurs.
Limites et sécurité
Comme les autres modèles Claude, Haiku est entraîné avec un accent sur l'innocuité et le refus des demandes dangereuses, en utilisant une combinaison de techniques de IA constitutionnelle et de retours humains. Cependant, sa taille plus réduite le rend plus susceptible aux tentatives de jailbreak par rapport à Opus. Anthropic a publié une fiche modèle détaillée documentant les modes de défaillance connus, notamment des erreurs factuelles occasionnelles sur des sujets de niche et une tendance à refuser excessivement des requêtes bénignes sur des sujets sensibles.
Haiku ne prend pas en charge l'entrée d'images, contrairement à Claude 3 Opus et Sonnet, qui ont des capacités multimodales. Cela limite son utilisation dans les tâches de raisonnement visuel. De plus, la date limite des connaissances du modèle est janvier 2024, ce qui signifie qu'il ne peut pas fournir d'informations sur des événements postérieurs à cette date sans augmentation par récupération externe.
Comparaison avec les prédécesseurs
Claude 3 Haiku est le successeur direct de Claude 2.1, qui était le précédent modèle compact d'Anthropic. Par rapport à Claude 2.1, Haiku offre une réduction de 50 % de la latence et une amélioration de 20 % sur les benchmarks standard, tout en conservant la même fenêtre de contexte. Le passage de l'ancienne architecture Encoder-Decoder Architecture à une conception purement décodeur a contribué à ces gains. Anthropic a également déclaré que Haiku est plus fiable pour suivre les instructions de formatage, une faiblesse courante des modèles antérieurs.
La sortie du modèle s'inscrivait dans une stratégie plus large de segmentation du marché, avec Opus ciblant le raisonnement à enjeux élevés, Sonnet pour des performances équilibrées et Haiku pour les applications à volume élevé et sensibles aux coûts. Cela reflète une hiérarchisation similaire par OpenAI avec sa gamme GPT-3.5 et GPT-4, bien qu'Anthropic mette l'accent sur le rapport vitesse-coût supérieur de Haiku.
Orientations futures
Anthropic n'a pas annoncé de successeur spécifique à Claude 3 Haiku, mais la feuille de route de recherche de l'entreprise suggère que les futurs modèles compacts intégreront des mécanismes d'attention plus efficaces et éventuellement Cross-Attention pour les entrées multimodales. Le succès de Haiku a également influencé les fabricants de matériel, avec AMD et Intel optimisant leurs accélérateurs pour les schémas d'inférence du modèle. Depuis début 2025, Haiku reste un choix populaire pour les développeurs cherchant un équilibre entre vitesse et capacité dans leurs applications.