DeepSeek V3.1 est une famille de grands modèles de langage développée par l'entreprise chinoise d'IA DeepSeek. Publiée en 2025, elle succède à DeepSeek V3, qui avait été introduit fin 2024. La famille V3.1 comprend quatre variantes qui sont apparues sur les classements publics de LLM et dans les médias, bien que l'entreprise n'ait pas publié de spécifications techniques détaillées pour toutes. Les modèles sont conçus pour la génération de texte à usage général, le raisonnement et les tâches de codage, et sont disponibles sous une licence open-source.
Le développement de DeepSeek V3.1 s'appuie sur l'architecture Transformer (architecture), utilisant spécifiquement une conception Mixture-of-Experts (MoE) qui active seulement un sous-ensemble de paramètres par jeton, améliorant ainsi l'efficacité computationnelle. La famille de modèles s'inscrit dans la tendance plus large de l'IA générative vers des systèmes de plus en plus grands et performants, en concurrence avec les offres de OpenAI, Anthropic et Google DeepMind. DeepSeek a positionné V3.1 comme une alternative économique, avec des coûts d'entraînement et d'inférence nettement inférieurs à ceux de nombreux homologues occidentaux.
Architecture et entraînement
DeepSeek V3.1 utilise un réseau de neurones avec une architecture Mixture-of-Experts, où chaque jeton est traité par un petit nombre de modules experts. Cette conception réduit le coût computationnel par jeton tout en maintenant une capacité élevée du modèle. Le modèle de base, DeepSeek V3, avait 671 milliards de paramètres au total avec 37 milliards activés par jeton ; V3.1 suit probablement une structure similaire, bien que les nombres exacts de paramètres pour les nouvelles variantes n'aient pas été officiellement divulgués. Les modèles sont entraînés à l'aide de techniques de apprentissage profond, y compris le réglage fin supervisé et l'apprentissage par renforcement à partir de retours humains (RLHF), pour aligner les sorties sur les préférences humaines.
Les données d'entraînement pour V3.1 comprennent un vaste corpus de texte multilingue, avec un accent sur l'anglais et le chinois. L'entreprise n'a pas publié de détails spécifiques sur la taille ou la composition de l'ensemble de données, mais il est connu que DeepSeek utilise une combinaison de données web publiques et de sources propriétaires. Le processus d'entraînement exploite des clusters de GPU, et DeepSeek a publié des recherches sur l'optimisation de l'efficacité de l'entraînement, y compris l'utilisation de l'entraînement en précision mixte FP8.
Variantes et benchmarks
Quatre variantes de DeepSeek V3.1 ont été identifiées dans des instantanés de benchmarks publics, différant probablement par le nombre de paramètres ou le réglage fin. Ces variantes ont été évaluées sur des benchmarks standard de LLM tels que MMLU (connaissances), HumanEval (génération de code) et MATH (raisonnement mathématique). Par exemple, une variante atteindrait un score de 88,5 % sur MMLU, surpassant le score de 86,2 % du V3 original sur le même test. Sur HumanEval, une variante obtient 82,3 %, contre 78,1 % pour V3. Ces scores placent V3.1 parmi les modèles à poids ouverts les plus performants, bien que les chiffres spécifiques varient selon la variante et la configuration d'évaluation.
Sur les classements médiatiques, tels que le score Elo de LMArena (Chatbot Arena), les variantes de DeepSeek V3.1 ont atteint des scores Elo dans la plage de 1300-1400, comparables à des modèles propriétaires comme GPT-4o et Claude 3.5 Sonnet. Cependant, les scores Elo exacts sont susceptibles de changer à mesure que davantage de votes d'utilisateurs sont collectés. Les modèles montrent également de bonnes performances dans les tâches de codage, avec une variante atteignant un score pass@1 de 75,4 % sur le benchmark SWE-bench, qui teste des problèmes réels d'ingénierie logicielle.
Publication et disponibilité
DeepSeek V3.1 a été publié début 2025, avec les premières variantes apparaissant sur l'API de l'entreprise et en téléchargements open-source. Les modèles sont distribués sous la licence MIT, permettant une utilisation commerciale et de recherche. DeepSeek a rendu les poids du modèle disponibles sur Hugging Face, et le code pour l'inférence est fourni sur GitHub. L'entreprise propose également une API avec des prix nettement inférieurs à ceux des modèles comparables de OpenAI ou Anthropic - par exemple, les jetons d'entrée sont facturés à 0,27 $ par million, et les jetons de sortie à 1,10 $ par million, à la date de publication.
La publication a été accompagnée d'un rapport technique détaillant la méthodologie d'entraînement et les résultats d'évaluation, bien que certains détails, tels que le nombre exact de jetons d'entraînement, soient omis. DeepSeek a également publié un article sur l'utilisation de l'attention multi-têtes et de l'encodage positionnel dans l'architecture du modèle, contribuant à la littérature académique plus large sur le apprentissage automatique.
Réception et impact
La publication de DeepSeek V3.1 a suscité une attention considérable dans la communauté de l'IA en raison de ses performances compétitives à une fraction du coût des modèles propriétaires. Il a été largement discuté sur les réseaux sociaux et dans la presse technologique, certains commentateurs notant qu'il démontre les progrès rapides des entreprises chinoises d'IA. La nature open-source du modèle a facilité son adoption dans la recherche et l'industrie, et il a été intégré dans divers outils et plateformes tiers.
Cependant, certains experts ont soulevé des préoccupations concernant le manque de transparence sur les données d'entraînement et les biais potentiels. DeepSeek n'a pas publié de fiche de modèle détaillée, et des audits indépendants n'ont pas été menés. En 2025, le modèle est toujours en développement actif, et des mises à jour futures sont attendues.
Comparaison avec les prédécesseurs
DeepSeek V3.1 améliore V3 dans plusieurs domaines clés, notamment le raisonnement, le codage et la compréhension multilingue. L'entreprise rapporte que V3.1 obtient une amélioration moyenne de 2,3 % sur 12 benchmarks standard par rapport à V3. Par exemple, sur le benchmark MMLU, V3.1 obtient 88,5 % contre 86,2 % pour V3, et sur le benchmark HumanEval, il obtient 82,3 % contre 78,1 %. Les améliorations sont attribuées à de meilleures données d'entraînement, un réglage fin plus raffiné et des ajustements architecturaux.
Contrairement à V3, qui avait un modèle unique, V3.1 est une famille de variantes, permettant aux utilisateurs de choisir un modèle qui équilibre performance et utilisation des ressources. Cette approche est similaire à celle d'autres fournisseurs, comme OpenAI avec GPT-4o et GPT-4o mini, bien que les variantes de DeepSeek soient toutes à poids ouverts. La publication de V3.1 inclut également un tokeniseur et une longueur de contexte mis à jour, avec un support allant jusqu'à 128K jetons, correspondant aux capacités des modèles leaders.
Orientations futures
DeepSeek continue d'itérer sur sa famille de modèles, et V3.1 devrait être suivi de mises à jour supplémentaires. L'entreprise a laissé entendre qu'elle travaillait sur des capacités multimodales, ce qui permettrait au modèle de traiter des images et de l'audio en plus du texte. En 2025, aucune date de publication officielle pour un V4 n'a été annoncée, mais le rythme rapide du développement suggère que de nouvelles versions apparaîtront dans l'année. L'impact des modèles de DeepSeek sur le paysage plus large de l'IA reste un sujet d'intérêt, en particulier dans le contexte de la concurrence mondiale en intelligence artificielle.