Traduit de l'anglais

DeepSeek V3 est un grand modèle de langage développé par DeepSeek, publié en décembre 2024. Il s'agit d'un transformateur à mélange d'experts avec 671B paramètres au total, connu pour ses performances solides sur les benchmarks publics et pour son entraînement économique.

DeepSeek V3 est un modèle de langage de grande taille développé par l'entreprise chinoise d'IA DeepSeek, publié pour la première fois le 26 décembre 2024. Il repose sur une architecture basée sur le transformeur, employant une conception de mélange d'experts (MoE), avec un total de 671 milliards de paramètres, dont 37 milliards sont activés par jeton. Le modèle a été entraîné sur 14,8 billions de jetons et se distingue par son processus d'entraînement rentable, utilisant prétendument seulement 2,788 millions d'heures de GPU H800.

DeepSeek V3 est apparu sur les classements publics de LLM et dans les médias peu après sa sortie, avec des instantanés de référence montrant des performances constantes sur plusieurs variantes. La famille de modèles comprend au moins cinq variantes dans ces instantanés, reflétant différents états de configuration ou de réglage fin, bien que les détails spécifiques de chaque variante ne soient pas documentés publiquement. Le modèle de base et sa version ajustée par instructions ont été évalués sur des références académiques standard.

Architecture et entraînement

DeepSeek V3 utilise une architecture de apprentissage profond avec 61 couches de blocs transformeurs. Il intègre une attention latente multi-têtes (MLA) pour une inférence efficace et emploie une structure DeepSeekMoE pour les couches feed-forward, où chaque jeton n'active qu'un sous-ensemble d'experts. Le modèle utilise un vocabulaire de 128 000 jetons et prend en charge une longueur de contexte de 128 000 jetons.

L'entraînement a été mené en utilisant un programme de taux d'apprentissage avec un taux d'apprentissage maximal de 2,4e-3, combiné à des techniques de écrêtage de gradient et de normalisation par lots adaptées à l'entraînement à grande échelle. L'ensemble de données comprenait 14,8 billions de jetons, principalement en anglais et en chinois, provenant de textes web, de livres et d'autres corpus organisés. Le processus d'entraînement a utilisé des GPU H800 fabriqués par TSMC, avec un coût rapporté d'environ 5,6 millions de dollars pour la dernière session d'entraînement.

Performances et références

Sur les références publiques, DeepSeek V3 a obtenu des scores notables. Sur la référence MMLU (Massive Multitask Language Understanding), il a obtenu 88,5 % dans un cadre à 5 tentatives. Sur la référence MATH-500, il a atteint 90,2 % dans un cadre à zéro tentative. Le modèle a également bien performé sur les tâches de codage, obtenant 82,6 % sur HumanEval et 67,3 % sur le plus exigeant LiveCodeBench.

En comparaison avec les modèles contemporains, les performances de DeepSeek V3 étaient compétitives avec les systèmes propriétaires de premier plan d'OpenAI et d'Anthropic, tout en étant nettement moins coûteux à entraîner. Sur la référence GPQA (Graduate-Level Google-Proof Q&A), il a obtenu 59,1 % dans un cadre à zéro tentative, et sur la référence DROP, il a atteint 91,6 % dans un cadre à 3 tentatives.

Publication et variantes

La première publication le 26 décembre 2024 comprenait le modèle de base et une version optimisée pour le chat, DeepSeek-V3-Chat. Les deux ont été rendus disponibles sous la licence MIT, permettant une utilisation commerciale et des modifications. Les poids du modèle ont été distribués via Hugging Face et d'autres plateformes, facilitant une adoption large dans la communauté IA générative.

Les instantanés de références publiques du début 2025 montrent au moins cinq variantes distinctes de DeepSeek V3, représentant probablement différents réglages fins ou niveaux de quantification. Ces variantes sont apparues sur des classements tels que le LMSYS Chatbot Arena et le Open LLM Leaderboard, bien que la configuration exacte de chaque variante ne soit pas officiellement documentée. Au début 2025, aucune variante officielle supplémentaire au-delà des versions de base et de chat n'avait été annoncée.

Impact et réception

La publication de DeepSeek V3 a généré une attention significative dans la communauté de l'intelligence artificielle en raison de sa combinaison de hautes performances et de faibles coûts d'entraînement. Il a démontré que des techniques d'entraînement efficaces pouvaient rivaliser avec les capacités de modèles développés avec des budgets nettement plus importants. La nature open-source du modèle sous la licence MIT a contribué à son intégration rapide dans diverses applications et projets de recherche.

Les critiques et analystes ont noté que l'efficacité d'entraînement de DeepSeek V3 était en partie due à son architecture MoE, qui réduit le coût computationnel pendant l'inférence. Cependant, la dépendance du modèle à un nombre total élevé de paramètres nécessite toujours une mémoire substantielle pour le déploiement. Le modèle a également suscité des discussions sur le paysage concurrentiel du apprentissage automatique, en particulier concernant le rôle des entreprises chinoises d'IA dans l'avancement des modèles open-source.

Détails techniques et limites

DeepSeek V3 emploie un encodage positionnel personnalisé et utilise des mécanismes de attention multi-têtes. Il n'utilise pas de Dropout traditionnel dans ses couches d'attention, un choix de conception qui améliore l'efficacité de l'entraînement. L'inférence du modèle prend en charge le échantillonnage top-p et la mise à l'échelle de température pour une génération contrôlée.

Malgré ses forces, DeepSeek V3 présente des limites. Il peut présenter des biais présents dans ses données d'entraînement, et ses performances sur les langues non anglaises au-delà du chinois sont moins rigoureusement évaluées. L'empreinte mémoire importante du modèle limite son déploiement sur du matériel grand public, nécessitant un élagage de modèle ou une quantification pour une utilisation pratique dans certains contextes. Au début 2025, le modèle n'a pas été mis à jour avec un successeur, bien que la recherche en cours chez DeepSeek se poursuive.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·artificial-intelligence·open-source-software·chinese-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique