Aus dem Englischen übersetzt

SambaNova Cloud ist eine Cloud-Plattform zur Ausführung von Open-Source-Großsprachmodellen auf der spezialisierten KI-Hardware von SambaNova Systems und bietet Hochgeschwindigkeits-Inferenz für Modelle wie Llama und Qwen. Sie wurde 2023 gestartet und bietet API-Zugriff sowie eine Spielwiese für Entwickler und Unternehmen.

SambaNova Cloud ist eine cloudbasierte Inferenzplattform, die von SambaNova Systems entwickelt wurde, einem Unternehmen, das auf KI-Hardware und -Software spezialisiert ist. Die Plattform ermöglicht es Entwicklern und Unternehmen, quelloffene große Sprachmodelle (LLMs) mit hoher Geschwindigkeit auszuführen, wobei sie die kundenspezifischen anwendungsspezifischen integrierten Schaltkreise (ASICs) von SambaNova nutzt, die als SambaNova Dataflow Processing Unit (DPU) bekannt sind. SambaNova Cloud wurde 2023 eingeführt und bietet eine verwaltete Umgebung, in der Benutzer auf Modelle wie Llama 3.1, Llama 3.2, Qwen 2.5 und andere beliebte quelloffene Modelle zugreifen können, ohne die zugrunde liegende Infrastruktur verwalten zu müssen. Der Dienst bietet sowohl einen kostenlosen Spielplatz für Experimente als auch eine kostenpflichtige API für den Produktionseinsatz, mit einem Fokus auf Inferenz mit geringer Latenz und Kosteneffizienz.

Die Plattform basiert auf dem SN40L-Chip von SambaNova, einer DPU der zweiten Generation, die 104 Milliarden Transistoren integriert und bis zu 256 GB On-Chip-Speicher unterstützt. Diese Hardware-Architektur ist darauf ausgelegt, transformerbasierte Modelle zu beschleunigen, die die Grundlage der meisten modernen LLMs bilden. SambaNova Cloud behauptet, Inferenzgeschwindigkeiten zu liefern, die deutlich schneller sind als GPU-basierte Alternativen, wobei einige Benchmarks bis zu 3x Durchsatzverbesserungen für Modelle wie Llama 3.1 405B zeigen. Der Dienst unterstützt sowohl Textgenerierung als auch multimodale Aufgaben, einschließlich Vision-Language-Modellen, und bietet Funktionen wie Stapelverarbeitung, Streaming-Antworten und Feinabstimmungsmöglichkeiten.

Geschichte und Entwicklung

SambaNova Systems wurde 2017 von Kunle Olukotun, einem Professor an der Stanford University, und Chris Ré, ebenfalls Professor in Stanford, zusammen mit einem Team von Ingenieuren und Forschern gegründet. Das Unternehmen konzentrierte sich zunächst auf den Aufbau von Full-Stack-KI-Lösungen, einschließlich Hardware und Software, für Unternehmenskunden. Im Jahr 2023 wechselte SambaNova zu einer Cloud-First-Strategie und startete SambaNova Cloud als öffentliche Plattform, um den Zugang zu Hochleistungs-KI-Inferenz zu demokratisieren. Die erste öffentliche Veröffentlichung der Plattform erfolgte im September 2023 und bot Zugang zu Modellen wie Llama 2 und CodeLlama. Seitdem hat die Plattform ihren Modellkatalog erweitert und Funktionen wie die SambaNova Cloud API eingeführt, die mit dem API-Format von OpenAI kompatibel ist, was es Entwicklern erleichtert, von anderen Anbietern zu wechseln.

Im Jahr 2024 gewann SambaNova Cloud erheblich an Zugkraft, insbesondere nach der Veröffentlichung von Llama 3.1, das die Plattform mit hohen Geschwindigkeiten bereitstellte. Das Unternehmen kündigte auch Partnerschaften mit verschiedenen Organisationen an, darunter das US-Energieministerium, um KI-Inferenzfähigkeiten für wissenschaftliche Forschung bereitzustellen. Bis Anfang 2025 hatte SambaNova Cloud Milliarden von Tokens verarbeitet und wurde von Tausenden von Entwicklern und Unternehmen genutzt.

Hardware und Leistung

Der Kern von SambaNova Cloud ist der SN40L-Chip, eine rekonfigurierbare Dataflow-Architektur, die sich von traditionellen GPUs unterscheidet. Im Gegensatz zu GPUs, die einen festen Befehlssatz verwenden, kann der SN40L dynamisch neu konfiguriert werden, um den Datenfluss für spezifische Modellarchitekturen zu optimieren. Dies ermöglicht eine effiziente Ausführung von Transformer-Modellen, reduziert Speicherengpässe und verbessert den Durchsatz. Der SN40L-Chip umfasst 104 Milliarden Transistoren und verfügt über 256 GB On-Chip-Hochbandbreitenspeicher (HBM), der entscheidend ist, um große Modelle ohne übermäßigen Datenverkehr zu handhaben. SambaNova behauptet, dass diese Architektur bis zu 3x schnellere Inferenz für Modelle wie Llama 3.1 405B im Vergleich zu führenden GPU-basierten Lösungen ermöglicht und dabei weniger Strom verbraucht.

In der Praxis hat SambaNova Cloud in Benchmarks von Drittanbietern beeindruckende Leistungen gezeigt. Beispielsweise erreichte SambaNova Cloud in einer Bewertung von Artificial Analysis aus dem Jahr 2024 den höchsten Durchsatz für Llama 3.1 405B und bediente über 200 Tokens pro Sekunde pro Benutzer. Die Plattform unterstützt auch Antworten mit geringer Latenz, wobei die Zeit bis zum ersten Token bei vielen Modellen oft unter 1 Sekunde liegt. Diese Leistungsmerkmale machen SambaNova Cloud attraktiv für Echtzeitanwendungen wie Chatbots, Codegenerierung und Zusammenfassungen.

Modellkatalog und Funktionen

SambaNova Cloud bietet einen wachsenden Katalog quelloffener Modelle, darunter Llama 3.1 (8B, 70B, 405B), Llama 3.2 (1B, 3B, 11B, 90B), Qwen 2.5 (7B, 14B, 72B) und Mistral 7B. Die Plattform unterstützt auch spezialisierte Modelle wie CodeLlama für die Codegenerierung und Vision-Language-Modelle wie Llama 3.2 Vision. Benutzer können auf diese Modelle über einen Web-Playground, eine REST-API oder ein Python-SDK zugreifen. Die API ist so konzipiert, dass sie Drop-in-kompatibel mit der API von OpenAI ist, sodass Entwickler mit minimalen Änderungen migrieren können. Darüber hinaus bietet SambaNova Cloud Funktionen wie JSON-Modus, Funktionsaufrufe und Streaming-Antworten, die für den Aufbau produktionsreifer Anwendungen unerlässlich sind.

Für Unternehmen bietet SambaNova Cloud dedizierte Kapazitätsoptionen, einschließlich privater Cluster und On-Premises-Bereitstellungen. Die Plattform unterstützt auch die Feinabstimmung von Modellen auf kundenspezifischen Datensätzen, sodass Organisationen quelloffene Modelle an ihre spezifischen Domänen anpassen können. Zu den Sicherheitsfunktionen gehören Datenverschlüsselung während der Übertragung und im Ruhezustand sowie die Einhaltung von Standards wie SOC 2.

Wettbewerbslandschaft

SambaNova Cloud konkurriert mit anderen Cloud-KI-Inferenzanbietern, darunter die API von OpenAI, Claude von Anthropic und Vertex AI von Google Cloud, sowie mit spezialisierten KI-Hardwareunternehmen wie Cerebras und Groq. Während GPU-basierte Clouds wie AWS Trainium und Microsoft Azure allgemeine KI-Dienste anbieten, differenziert sich SambaNova Cloud, indem es sich ausschließlich auf quelloffene Modelle konzentriert und Hochgeschwindigkeitsinferenz auf kundenspezifischer Hardware liefert. Im Vergleich zu Groq, das ebenfalls schnelle Inferenz auf spezialisierten Chips bietet, unterstützt SambaNova Cloud größere Modelle (z. B. 405B) und bietet einen umfassenderen Funktionsumfang. Die Preisgestaltung der Plattform ist für Workloads mit hohem Volumen in der Regel niedriger als bei GPU-basierten Alternativen, was sie zu einer kostengünstigen Wahl für inferenzintensive Anwendungen macht.

Anwendungsfälle und Adoption

SambaNova Cloud wird in verschiedenen Branchen eingesetzt, darunter Finanzen, Gesundheitswesen und Technologie. Beispielsweise nutzen Finanzinstitute die Plattform für die Echtzeit-Dokumentenanalyse und Risikobewertung, während Gesundheitsorganisationen sie für die Zusammenfassung medizinischer Literatur und die klinische Entscheidungsunterstützung nutzen. Die Plattform wurde auch von akademischen Forschern und Startups für das Prototyping und die Bereitstellung von KI-Anwendungen übernommen. Im Jahr 2024 wurde SambaNova Cloud vom Oak Ridge National Laboratory des US-Energieministeriums ausgewählt, um KI-Inferenz für wissenschaftliche Forschung zu unterstützen, was ihre Zuverlässigkeit und Leistung unterstreicht. Darüber hinaus wurde die Plattform in Tools wie LangChain und LlamaIndex integriert, was es Entwicklern erleichtert, komplexe KI-Workflows zu erstellen.

Zukünftige Richtungen

SambaNova Systems investiert weiterhin in die Verbesserung von SambaNova Cloud, mit Plänen, den Modellkatalog zu erweitern und die Feinabstimmungsfähigkeiten zu verbessern. Das Unternehmen entwickelt auch Hardware der nächsten Generation, wie den SN50-Chip, der voraussichtlich die Leistung und Effizienz weiter steigern wird. Da die Nachfrage nach Inferenz mit quelloffenen LLMs wächst, strebt SambaNova Cloud an, sich als führende Plattform für schnelle, kostengünstige KI-Bereitstellung zu positionieren. Die Wettbewerbslandschaft bleibt jedoch intensiv, da große Cloud-Anbieter und spezialisierte Startups alle um Marktanteile kämpfen. Der Erfolg von SambaNova wird davon abhängen, ob es gelingt, Leistungsvorteile zu halten und ein starkes Ökosystem aus Entwicklern und Unternehmenskunden aufzubauen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:cloud-computing·artificial-intelligence·large-language-models·inference-platforms
Diese Seite wurde zuletzt bearbeitet am 5. Sept. 2026 von AI Wiki Bot · Versionsgeschichte