Aus dem Englischen übersetzt

DeepSeek ist ein chinesisches Unternehmen für künstliche Intelligenz, das im Juli 2023 von Liang Wenfeng gegründet wurde und offene große Sprachmodelle mit offenen Gewichten entwickelt. Es gehört zu High-Flyer und veröffentlichte bemerkenswerte Modelle, darunter DeepSeek-V2 und R1 im Jahr 2024.

DeepSeek ist ein chinesisches Unternehmen für künstliche Intelligenz, das große Sprachmodelle (LLMs) mit offenen Gewichten entwickelt. Mit Sitz in Hangzhou, Zhejiang, gehört es dem chinesischen Hedgefonds High-Flyer und wird von diesem finanziert. Das Unternehmen wurde im Juli 2023 von Liang Wenfeng gegründet und konzentriert sich auf forschungsorientierte KI-Entwicklung, wobei seine Modelle unter Lizenzen mit offenen Gewichten öffentlich zugänglich gemacht werden.

DeepSeeks Ansatz betont rechnerische Effizienz und eine breite Rekrutierung über traditionelle Informatikbereiche hinaus. Seine Modelle wurden von großen Cloud-Anbietern gehostet und haben internationale Aufmerksamkeit für ihre Leistung und Zugänglichkeit erlangt, insbesondere in Regionen, die nach Alternativen zu westlichen KI-Plattformen suchen.

Gründung und frühe Geschichte

DeepSeek führt seine Ursprünge auf High-Flyer zurück, das im Juni 2015 von Liang Wenfeng mitgegründet wurde. High-Flyer begann am 21. Oktober 2016, GPU-abhängige Deep-Learning-Modelle für den Aktienhandel einzusetzen, und wechselte damit von früheren CPU-basierten linearen Modellen. Bis Ende 2017 wurde der Großteil seiner Handelsaktivitäten von KI gesteuert.

Im Jahr 2019 baute High-Flyer seinen ersten Rechencluster, Fire-Flyer, zu Kosten von 200 Millionen Yuan. Der Cluster enthielt 1.100 GPUs, die mit 200 Gbit/s verbunden waren, und war 1,5 Jahre lang in Betrieb, bevor er stillgelegt wurde. Bis 2021 hatte Liang begonnen, große Mengen an Nvidia-GPUs zu kaufen, wobei er Berichten zufolge 10.000 Nvidia-A100-GPUs beschaffte, bevor die US-Beschränkungen für Chipverkäufe an China in Kraft traten.

Der Bau von Fire-Flyer 2 begann 2021 mit einem Budget von 1 Milliarde Yuan. Im Jahr 2022 wurde die Kapazität des Clusters zu über 96 % genutzt, insgesamt 56,74 Millionen GPU-Stunden, wobei 27 % der Kapazität wissenschaftliches Rechnen außerhalb des Unternehmens unterstützten. Fire-Flyer 2 verwendete zunächst 5.000 PCIe-A100-GPUs in 625 Knoten, die jeweils 8 GPUs enthielten, und integrierte später NVLinks und die Nvidia Collective Communications Library für größere Modelle.

Am 14. April 2023 kündigte High-Flyer die Einrichtung eines Forschungslabors für künstliche allgemeine Intelligenz (AGI) an. Zwei Monate später, am 17. Juli 2023, wurde dieses Labor in ein unabhängiges Unternehmen namens DeepSeek ausgegliedert, mit High-Flyer als Hauptinvestor. Zunächst waren Risikokapitalgeber aufgrund von Bedenken hinsichtlich schneller Exits zurückhaltend, Finanzmittel bereitzustellen.

Modellveröffentlichungen 2024

Im Jahr 2024 veröffentlichte DeepSeek mehrere bedeutende Modelle im Rahmen seines Frameworks mit offenen Gewichten. DeepSeek-V2, das Anfang 2024 eingeführt wurde, zeigte Fortschritte in der Modellarchitektur und der Trainingseffizienz. Das Unternehmen verfeinerte seine Algorithmen weiter, um die rechnerische Effizienz zu maximieren, nutzte ältere Hardware und reduzierte den Energieverbrauch aufgrund der US-Chipbeschränkungen.

DeepSeek-R1, das im Januar 2025 zusammen mit einem gleichnamigen Chatbot eingeführt wurde, markierte einen wichtigen Meilenstein. Das Modell erlangte internationale Anerkennung für seine Denkfähigkeiten und seinen kosteneffizienten Trainingsansatz. Seit Januar 2025 veröffentlicht DeepSeek seine Modelle unter freien und Open-Source-Softwarelizenzen.

Unternehmensabläufe

DeepSeek hat seinen Hauptsitz in Hangzhou, Zhejiang, mit Liang Wenfeng als CEO. Stand Mai 2024 hielt Liang persönlich einen Anteil von 84 % an DeepSeek über zwei Briefkastenfirmen. Das Unternehmen konzentriert sich auf Forschung und hat erklärt, dass es keine unmittelbaren Pläne zur Kommerzialisierung hat, wodurch es bestimmte Bestimmungen der chinesischen KI-Vorschriften umgehen kann, die auf verbraucherorientierte Technologien abzielen.

Aufgrund seines Frameworks mit offenen Gewichten wurden DeepSeek-Modelle nativ von Cloud-Anbietern wie Microsoft Azure und Perplexity AI gehostet. Im Februar 2026 beschuldigte Anthropic DeepSeek, Tausende betrügerischer Konten verwendet zu haben, um Millionen von Gesprächen mit Claude zu generieren, um seine eigenen LLMs zu trainieren. Im April 2026 begannen Investoren Gespräche über eine Finanzierungsrunde von 300 Millionen US-Dollar, die das Unternehmen auf eine Bewertung von 10 Milliarden US-Dollar bringen würde. DeepSeek schloss im Mai 2026 eine Serie-A-Runde ab und erhielt 7 Milliarden US-Dollar, was zu einer Post-Money-Bewertung von 52 Milliarden US-Dollar führte. Im Juli 2026 berichteten Bloomberg und die Financial Times über Vorbereitungen für einen Börsengang bereits 2027, mit einer weiteren Diskussion, die auf eine Pre-Money-Bewertung von 70 Milliarden US-Dollar abzielte.

Trainingsframework

DeepSeek betreibt die Rechencluster Fire-Flyer und Fire-Flyer 2. Fire-Flyer 2, der Stand 2025 noch in Betrieb ist, besteht aus einer gemeinsam entwickelten Software- und Hardwarearchitektur. Die Hardware verwendet Nvidia-GPUs mit 200-Gbit/s-Verbindungen, die in zwei Zonen mit zonenübergreifender Aufgabenunterstützung unterteilt sind. Die Netzwerktopologie verwendet zwei Fat Trees für eine hohe Bisektionsbandbreite.

Zu den wichtigsten Softwarekomponenten gehören 3FS (Fire-Flyer File System), ein verteiltes paralleles Dateisystem, das für asynchrone Zufallslesevorgänge mit Direct I/O und RDMA Read entwickelt wurde. Da jeder Datenlesevorgang zufällig ist und nicht wiederverwendet wird, ist Caching unnötig. Eine weitere Komponente ist hfreduce, eine asynchrone Kommunikationsbibliothek, die ursprünglich entwickelt wurde, um Funktionen der Nvidia Collective Communications Library zu ersetzen.

Strategie und Einstellung

DeepSeeks Einstellungsansatz betont Fähigkeiten gegenüber langer Berufserfahrung, was dazu führt, dass viele Neueinstellungen direkt von der Universität kommen. Das Unternehmen rekrutiert Personen ohne Informatikhintergrund, um Fachwissen in Bereichen wie Poesie und fortgeschrittener Mathematik zu erweitern. Laut The New York Times haben Dutzende DeepSeek-Forscher Verbindungen zu Laboren der Volksbefreiungsarmee und den Sieben Söhnen der Nationalen Verteidigung oder hatten diese zuvor.

Seit 2025 wurde DeepSeeks Chatbot von der Volksbefreiungsarmee in nicht-kampfbezogenen Rollen übernommen, darunter Krankenhäuser, die paramilitärische Volkspolizei und nationale Mobilisierungsorganisationen. Das Unternehmen hat sich auch nach Afrika ausgeweitet und bietet erschwinglichere und weniger stromhungrige KI-Lösungen an, was afrikanische Sprachmodelle stärkt und Startups hervorbringt, beispielsweise in Nairobi. Zusammen mit Huaweis Speicher- und Cloud-Computing-Diensten ist DeepSeeks Einfluss auf die Technologieszene Subsahara-Afrikas beträchtlich und bietet lokale Datensouveränität und Flexibilität im Vergleich zu westlichen KI-Plattformen.

Rezeption und Auswirkungen

DeepSeeks Modelle wurden für ihre Effizienz und offene Zugänglichkeit im Ökosystem großer Sprachmodelle anerkannt. Der Fokus des Unternehmens auf Forschung statt Kommerzialisierung unterscheidet es von Wettbewerbern wie OpenAI und Anthropic. Seine Trainingsinnovationen, einschließlich der Fire-Flyer-Cluster und benutzerdefinierter Software, tragen zu breiteren Entwicklungen im maschinellen Lernen und Deep Learning bei.

DeepSeeks Expansion nach Afrika und seine kosteneffizienten Lösungen haben es als bedeutenden Akteur bei der globalen KI-Adoption positioniert, insbesondere in Regionen mit begrenzter Infrastruktur. Der Ansatz mit offenen Gewichten ermöglicht lokale Anpassung und Bereitstellung und fördert eine wachsende Gemeinschaft von Entwicklern und Startups.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·large-language-model·chinese-company·open-source-software
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte