Aus dem Englischen übersetzt

DeepSeek V3.1 ist ein großes Sprachmodell, das von DeepSeek entwickelt und 2025 veröffentlicht wurde, wobei mehrere Varianten in öffentlichen Benchmarks erscheinen. Es baut auf der Mixture-of-Experts-Architektur seines Vorgängers DeepSeek V3 auf.

DeepSeek V3.1 ist eine Familie von Large Language Models, die von dem chinesischen KI-Unternehmen DeepSeek entwickelt wurde. Sie wurde 2025 veröffentlicht und ist der Nachfolger von DeepSeek V3, das Ende 2024 eingeführt worden war. Die V3.1-Familie umfasst vier Varianten, die auf öffentlichen LLM- und Medien-Bestenlisten erschienen sind, obwohl das Unternehmen für alle von ihnen keine detaillierten technischen Spezifikationen veröffentlicht hat. Die Modelle sind für allgemeine Textgenerierung, Reasoning und Programmieraufgaben konzipiert und sind unter einer Open-Source-Lizenz verfügbar.

Die Entwicklung von DeepSeek V3.1 baut auf der Transformer (architecture)-Architektur auf, insbesondere unter Verwendung eines Mixture-of-Experts-Designs (MoE), das pro Token nur eine Teilmenge der Parameter aktiviert, was die Recheneffizienz verbessert. Die Modellfamilie ist Teil des breiteren Trends in der generativen KI hin zu zunehmend großen und leistungsfähigen Systemen und konkurriert mit Angeboten von OpenAI, Anthropic und Google DeepMind. DeepSeek positioniert V3.1 als kostengünstige Alternative, wobei die Trainings- und Inferenzkosten deutlich niedriger sind als bei vielen westlichen Gegenstücken.

Architektur und Training

DeepSeek V3.1 verwendet ein neuronales Netz mit einer Mixture-of-Experts-Architektur, bei der jeder Token von einer kleinen Anzahl von Expertenmodulen verarbeitet wird. Dieses Design reduziert die Rechenkosten pro Token, während eine hohe Modellkapazität erhalten bleibt. Das Basismodell DeepSeek V3 hatte insgesamt 671 Milliarden Parameter mit 37 Milliarden aktivierten pro Token; V3.1 folgt wahrscheinlich einer ähnlichen Struktur, obwohl die genauen Parameterzahlen für die neuen Varianten nicht offiziell bekannt gegeben wurden. Die Modelle werden mit Deep-Learning-Techniken trainiert, einschließlich überwachtem Feintuning und Reinforcement Learning aus menschlichem Feedback (RLHF), um die Ausgaben an menschliche Präferenzen anzupassen.

Die Trainingsdaten für V3.1 umfassen ein großes Korpus mehrsprachiger Texte mit einem Schwerpunkt auf Englisch und Chinesisch. Das Unternehmen hat keine spezifischen Details zur Datensatzgröße oder -zusammensetzung veröffentlicht, aber es ist bekannt, dass DeepSeek eine Kombination aus öffentlich verfügbaren Webdaten und proprietären Quellen verwendet. Der Trainingsprozess nutzt GPU-Cluster, und DeepSeek hat Forschung zur Optimierung der Trainingseffizienz veröffentlicht, einschließlich der Verwendung von FP8-Mixed-Precision-Training.

Varianten und Benchmarks

Vier Varianten von DeepSeek V3.1 wurden in öffentlichen Benchmark-Snapshots identifiziert, die sich wahrscheinlich in der Parameteranzahl oder im Feintuning unterscheiden. Diese Varianten wurden anhand standardmäßiger LLM-Benchmarks wie MMLU (Wissen), HumanEval (Codegenerierung) und MATH (mathematisches Reasoning) evaluiert. Beispielsweise erreicht eine Variante laut Berichten eine Punktzahl von 88,5 % bei MMLU und übertrifft damit die ursprüngliche V3 mit 86,2 % im selben Test. Bei HumanEval erzielt eine Variante 82,3 %, verglichen mit 78,1 % bei V3. Diese Punktzahlen platzieren V3.1 unter den leistungsstärksten Open-Weight-Modellen, obwohl die spezifischen Zahlen je nach Variante und Evaluierungssetup variieren.

Auf Medien-Bestenlisten, wie dem LMArena (Chatbot Arena) Elo-Rating, haben DeepSeek-V3.1-Varianten Elo-Werte im Bereich von 1300-1400 erreicht, vergleichbar mit proprietären Modellen wie GPT-4o und Claude 3.5 Sonnet. Die genauen Elo-Ratings können sich jedoch ändern, da weitere Nutzerstimmen gesammelt werden. Die Modelle zeigen auch starke Leistungen bei Programmieraufgaben, wobei eine Variante einen pass@1-Wert von 75,4 % beim SWE-bench-Benchmark erreicht, der reale Softwareentwicklungsprobleme testet.

Veröffentlichung und Verfügbarkeit

DeepSeek V3.1 wurde Anfang 2025 veröffentlicht, wobei die ersten Varianten auf der API des Unternehmens und als Open-Source-Downloads erschienen. Die Modelle werden unter der MIT-Lizenz vertrieben, die kommerzielle und Forschung Nutzung erlaubt. DeepSeek hat die Modellgewichte auf Hugging Face verfügbar gemacht, und der Code für die Inferenz wird auf GitHub bereitgestellt. Das Unternehmen bietet auch eine API mit Preisen an, die deutlich niedriger sind als bei vergleichbaren Modellen von OpenAI oder Anthropic - zum Beispiel werden Eingabe-Tokens mit 0,27 US-Dollar pro Million und Ausgabe-Tokens mit 1,10 US-Dollar pro Million zum Veröffentlichungsdatum bepreist.

Die Veröffentlichung wurde von einem technischen Bericht begleitet, der die Trainingsmethodik und Evaluierungsergebnisse detailliert beschreibt, obwohl einige Spezifika, wie die genaue Anzahl der Trainings-Tokens, ausgelassen werden. DeepSeek hat auch ein Papier über die Verwendung von Multi-Head-Attention und Positional Encoding in der Modellarchitektur veröffentlicht, was zur breiteren akademischen Literatur über maschinelles Lernen beiträgt.

Rezeption und Auswirkungen

Die Veröffentlichung von DeepSeek V3.1 erregte in der KI-Gemeinschaft erhebliche Aufmerksamkeit aufgrund seiner wettbewerbsfähigen Leistung zu einem Bruchteil der Kosten proprietärer Modelle. Es wurde in sozialen Medien und in der Tech-Presse breit diskutiert, wobei einige Kommentatoren anmerkten, dass es den raschen Fortschritt chinesischer KI-Unternehmen demonstriert. Die Open-Source-Natur des Modells hat seine Annahme in Forschung und Industrie erleichtert, und es wurde in verschiedene Drittanbieter-Tools und -Plattformen integriert.

Einige Experten haben jedoch Bedenken hinsichtlich des Mangels an Transparenz bezüglich der Trainingsdaten und potenzieller Verzerrungen geäußert. DeepSeek hat keine detaillierte Modellkarte veröffentlicht, und unabhängige Audits wurden nicht durchgeführt. Ab 2025 befindet sich das Modell noch in aktiver Entwicklung, und zukünftige Updates werden erwartet.

Vergleich mit Vorgängern

DeepSeek V3.1 verbessert V3 in mehreren Schlüsselbereichen, einschließlich Reasoning, Programmierung und mehrsprachigem Verständnis. Das Unternehmen berichtet, dass V3.1 eine durchschnittliche Verbesserung von 2,3 % über 12 Standard-Benchmarks im Vergleich zu V3 erzielt. Zum Beispiel erreicht V3.1 beim MMLU-Benchmark 88,5 % gegenüber 86,2 % bei V3, und beim HumanEval-Benchmark 82,3 % gegenüber 78,1 %. Die Verbesserungen werden auf bessere Trainingsdaten, verfeinertes Feintuning und architektonische Anpassungen zurückgeführt.

Im Gegensatz zu V3, das ein einzelnes Modell hatte, ist V3.1 eine Familie von Varianten, die es Benutzern ermöglicht, ein Modell zu wählen, das Leistung und Ressourcennutzung ausbalanciert. Dieser Ansatz ähnelt dem anderer Anbieter, wie OpenAIs GPT-4o und GPT-4o mini, obwohl DeepSeek-Varianten alle Open-Weight sind. Die Veröffentlichung von V3.1 umfasst auch einen aktualisierten Tokenizer und eine aktualisierte Kontextlänge mit Unterstützung für bis zu 128K Tokens, was den Fähigkeiten führender Modelle entspricht.

Zukünftige Richtungen

DeepSeek iteriert weiterhin an seiner Modellfamilie, und es wird erwartet, dass V3.1 von weiteren Updates gefolgt wird. Das Unternehmen hat auf Arbeiten an multimodalen Fähigkeiten angedeutet, die es dem Modell ermöglichen würden, Bilder und Audio zusätzlich zu Text zu verarbeiten. Ab 2025 wurde kein offizielles Veröffentlichungsdatum für eine V4 angekündigt, aber das schnelle Entwicklungstempo deutet darauf hin, dass neue Versionen innerhalb des Jahres erscheinen werden. Die Auswirkungen der DeepSeek-Modelle auf die breitere KI-Landschaft bleiben ein Thema von Interesse, insbesondere im Kontext des globalen Wettbewerbs in der künstlichen Intelligenz.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-models·artificial-intelligence·deep-learning·open-source-software
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte