Scale AI, Inc. ist ein amerikanisches Unternehmen für Infrastruktur und Software im Bereich künstliche Intelligenz mit Sitz in San Francisco, Kalifornien. Ursprünglich auf Datenannotation spezialisiert, bietet das Unternehmen auch Dienstleistungen für Reinforcement Learning aus menschlichem Feedback (RLHF), Bewertung großer Sprachmodelle (LLM) sowie Unternehmenssoftware-Suiten zur Entwicklung und Bereitstellung von KI-Anwendungen an. Sein Forschungszweig, das Safety, Evaluation and Alignment Lab, konzentriert sich auf die Bewertung und Ausrichtung von LLMs und war Mitentwickler des Benchmarks Humanity's Last Exam.
Scale AI lagert die Datenkennzeichnung über seine Tochtergesellschaften Remotasks, die sich auf Computer Vision und autonome Fahrzeuge konzentriert, und Outlier, die sich auf die Annotation von Daten für LLMs spezialisiert, aus. Das Unternehmen betreibt ein LLM Red Team, das menschliche Adversarial-Tests durchführt, um Schwachstellen, Verzerrungen und Sicherheitsrisiken in KI-Modellen zu identifizieren, und arbeitet dabei mit Organisationen wie OpenAI und Google DeepMind sowie nationalen KI-Sicherheitsinstituten zusammen. Zu den kommerziellen Kunden gehörten Google, Microsoft, Meta, General Motors, OpenAI und Time, während das Unternehmen auch mit Regierungen zusammenarbeitet, darunter die Vereinigten Staaten bei militärbezogenen Projekten und Katar bei der Effizienz von Sozialprogrammen.
Geschichte
Frühe Jahre (2016–2019)
Scale wurde 2016 von Alexandr Wang und Lucy Guo über Y Combinator gegründet, nachdem die beiden zuvor gemeinsam bei Quora gearbeitet hatten. Zu den ersten Investoren gehörten Dragoneer Investment Group, Tiger Global Management und Index Ventures. Guo wurde 2018 entlassen. Im August 2019, nachdem der Founders Fund von Peter Thiel eine Investition von 100 Millionen Dollar getätigt hatte, überstieg die Bewertung von Scale eine Milliarde Dollar, was dem Unternehmen den Status eines Einhorns verlieh.
Wachstum (2019–2025)
Scale schloss im Jahr 2020 einen Vertrag mit dem Verteidigungsministerium der Vereinigten Staaten ab. Im Mai 2021 trat Michael Kratsios, ehemaliger Chief Technology Officer der Vereinigten Staaten unter der Trump-Administration, als Managing Director und Leiter der Strategieabteilung bei. Bis Juli 2021 erreichte Scale eine Bewertung von 7 Milliarden Dollar nach einer Finanzierungsrunde unter der Führung von Greenoaks, Dragoneer und Tiger Global, angetrieben durch die gestiegene Nachfrage nach Datenkennzeichnung in verschiedenen Branchen.
Im Januar 2022 gewann Scale einen Auftrag über 250 Millionen Dollar, um amerikanischen Bundesbehörden Zugang zu seiner Tool-Suite zu verschaffen. Im Februar 2022 entwickelte das Unternehmen den Automated Damage Identification Service als Reaktion auf die russische Invasion in der Ukraine, der Satellitenbilder analysiert, um Gebäudeschäden zu messen, und Berichte für humanitäre Organisationen mit Geotags versieht. Im November 2022 wurde Scale von Time in die Liste der Best Inventions of 2022 aufgenommen und eröffnete ein Büro in St. Louis.
Im Januar 2023 entließ Scale 20 Prozent seiner Belegschaft. Im Mai 2023 unterzeichnete das Unternehmen einen Vertrag mit dem XVIII Airborne Corps der US-Armee und war damit das erste KI-Unternehmen, das sein LLM, bekannt als Donovan, in einem klassifizierten Netzwerk einsetzte. Im August 2023 wurde Scale zum bevorzugten Partner von OpenAI für die Feinabstimmung von GPT-3.5, und seine Dienste wurden zur Erstellung von ChatGPT verwendet. Im selben Monat wurde die Bewertungsplattform von Scale bei DEF CON für das erste generative KI-Red-Team-Event eingesetzt, bei dem Modelle verschiedener Unternehmen getestet wurden. Im Dezember 2023 trug Scale zur Purple-Llama-Initiative von Meta bei, einem Sicherheitsrahmenwerk für offene generative KI-Modelle.
Im Februar 2024 wurde Scale vom Verteidigungsministerium ausgewählt, um dessen LLMs im Rahmen eines Einjahresvertrags für militärische Zwecke zu testen und zu bewerten. Im März 2024 erreichte Scale eine Bewertung von fast 13 Milliarden Dollar, nachdem Accel eine weitere Finanzierungsrunde anführte. Im Mai 2024 sammelte das Unternehmen zusätzlich eine Milliarde Dollar mit neuen Investoren, darunter Amazon und Meta, ein, wodurch die Bewertung auf 14 Milliarden Dollar stieg. Im August 2024 unterzeichnete Scale eine Vereinbarung mit dem US AI Safety Institute, das vom National Institute of Standards and Technology des Handelsministeriums kontrolliert wird, um bei Forschung, Tests und Bewertungen zusammenzuarbeiten.
Im Dezember 2024 wurde Scale von einem ehemaligen Mitarbeiter verklagt, der Lohnunterschlagung und falsche Einstufung von Arbeitnehmern vorwarf; ein zweiter Mitarbeiter reichte im folgenden Monat eine ähnliche Klage ein. Im Januar 2025 verklagten mehrere Auftragnehmer Scale mit der Behauptung, durch den Kontakt mit verstörenden Inhalten psychischen Schaden erlitten zu haben. Im selben Monat berichtete The Conversation, dass Scale und Meta zuvor zusammengearbeitet hatten, um Defense Llama zu entwickeln und zu verkaufen, ein LLM-Produkt für militärische Verteidigungszwecke. Scale schaltete außerdem eine ganzseitige Anzeige in der Washington Post, in der Präsident Donald Trump aufgefordert wurde, den "KI-Krieg zu gewinnen". Später im Januar veröffentlichten Scale und das Center for AI Safety Humanity's Last Exam, einen Benchmark für KI-Systeme, und Scale half bei der Entwicklung der Benchmarks EnigmaEval, MultiChallenge und MASK.
Im Februar 2025 vereinbarte Scale eine fünfjährige Partnerschaft mit der Regierung Katars zur Verbesserung staatlicher Dienstleistungen durch KI-Tools und Schulungen, einschließlich prädiktiver Analytik, Automatisierung und fortgeschrittener Datenanalyse, die auf dem Web Qatar 2025 Summit unterzeichnet wurde. Ebenfalls im Februar wurde Scale Drittanbieter-Bewerter von KI-Modellen für das US AI Safety Institute. Im März 2025 schloss Scale einen Millionenvertrag mit dem Verteidigungsministerium zur Entwicklung des Thunderforge-Projekts ab, einem wichtigen Schritt in der militärischen Automatisierung der USA, der darauf abzielt, KI zur Planung und Unterstützung der Ausführung von Bewegungen von Schiffen, Flugzeugen und anderen Vermögenswerten einzusetzen. Der Vertrag, der von der Defense Innovation Unit an Scale, Anduril Industries und Microsoft vergeben wurde, war für die erste Verwendung bei USINDOPACOM und EUCOM vorgesehen. Im April 2025 veröffentlichte Scale Scale Evaluation, eine Plattform zum Testen von LLMs gegen Benchmarks, um Schwachstellen zu identifizieren und zu kennzeichnen, wo zusätzliche Trainingsdaten die Modelle verbessern würden.
Zusätzliche Investition von Meta (2025)
Am 10. Juni 2025 erklärte sich Meta Platforms bereit, einen nicht stimmberechtigten Anteil von 49 Prozent an Scale AI für 14,8 Milliarden Dollar zu erwerben. Das Unternehmen blieb eine eigenständige, von Meta unabhängige Einheit. Der ehemalige CEO Alexandr Wang übernahm im Rahmen des Deals eine Spitzenposition bei Meta und wurde durch Jason Droege, den Chief Strategy Officer des Unternehmens und ehemaligen Uber-Manager, ersetzt.
Scale Labs
Im März 2026 startete das Unternehmen Scale Lab, eine Initiative zur Förderung von KI-Forschung und -Entwicklung, wobei spezifische Details seiner Aktivitäten zu diesem Zeitpunkt nicht weit verbreitet waren.
Dienstleistungen und Produkte
Scale AI bietet eine Suite von Tools für die Datenannotation, einschließlich Bild-, Video- und Textkennzeichnung, die für das Training von maschinellem Lernen-Modellen unerlässlich sind. Die RLHF-Dienste des Unternehmens helfen, LLMs an menschliche Präferenzen anzupassen, ein entscheidender Schritt bei der Entwicklung von Systemen wie großen Sprachmodellen. Die Bewertungsplattformen des Unternehmens, wie Scale Evaluation, ermöglichen es Organisationen, die Modellleistung gegen Benchmarks zu testen, Schwachstellen zu identifizieren und Trainingsdaten zu verbessern. Für Unternehmenskunden bietet Scale Software-Suiten zur Entwicklung und Bereitstellung von KI-Anwendungen an, einschließlich Tools für Modellüberwachung und Sicherheitstests.
Das LLM Red Team führt Adversarial-Tests durch, um Schwachstellen, Verzerrungen und Sicherheitsrisiken aufzudecken, und simuliert dabei oft komplexe Bedrohungen wie Cyberangriffe, Jailbreaks und agentische KI-Verhaltensweisen. Diese Arbeit unterstützt sowohl kommerzielle Kunden als auch Regierungsbehörden, einschließlich nationaler KI-Sicherheitsinstitute.
Regierungs- und Militärarbeit
Scale AI hat ein bedeutendes Portfolio an Regierungsaufträgen. Die Arbeit mit dem US-Verteidigungsministerium umfasst das Thunderforge-Projekt, das die Automatisierung militärischer Planung und Ausführung anstrebt, sowie frühere Verträge zum Testen und Bewerten von LLMs für militärische Zwecke. Das Unternehmen hat außerdem mit der Regierung Katars zusammengearbeitet, um Sozialprogramme durch KI zu verbessern, und mit dem US AI Safety Institute für die Modellbewertung. Diese Kooperationen haben aufgrund ethischer Bedenken hinsichtlich KI in militärischen Kontexten Aufmerksamkeit erregt, aber Scale hat sich als führend bei der sicheren und ausgerichteten KI-Bereitstellung positioniert.
Forschung und Benchmarks
Das Safety, Evaluation and Alignment Lab von Scale konzentriert sich auf die Bewertung und Ausrichtung von LLMs und trägt zur Entwicklung von Benchmarks wie Humanity's Last Exam bei, das KI-Systeme über ein breites Spektrum von Wissens- und Denkaufgaben testet. Das Unternehmen hat auch bei der Erstellung von EnigmaEval, MultiChallenge und MASK geholfen, die auf spezifische Fähigkeiten wie Denken, mehrstufige Problemlösung und Sicherheit abzielen. Diese Benchmarks werden von Forschern und Entwicklern verwendet, um die Modellleistung zu bewerten und Verbesserungen zu steuern.
Rechtliche und ethische Fragen
Scale sah sich rechtlichen Herausforderungen im Zusammenhang mit Arbeitspraktiken gegenüber. Im Dezember 2024 verklagte ein ehemaliger Mitarbeiter das Unternehmen wegen Lohnunterschlagung und falscher Einstufung von Arbeitnehmern, gefolgt von einer ähnlichen Klage im Januar 2025. Darüber hinaus verklagten Auftragnehmer Scale im Januar 2025 und behaupteten psychischen Schaden durch den Kontakt mit verstörenden Inhalten während Datenkennzeichnungsaufgaben. Diese Fälle verdeutlichen anhaltende Bedenken hinsichtlich der Arbeitsbedingungen von Datenannotatoren, die häufig mit sensiblen oder traumatischen Materialien umgehen. Scale hat diese Fälle bis Anfang 2026 nicht öffentlich beigelegt.
Führung und Struktur
Alexandr Wang gründete Scale mit und war bis Juni 2025 CEO, als er im Rahmen des Investitionsdeals zu Meta wechselte. Jason Droege, der zuvor Chief Strategy Officer war und bei Uber gearbeitet hatte, folgte ihm als CEO nach. Das Unternehmen hat seinen Hauptsitz in San Francisco, Kalifornien, und betreibt die Tochtergesellschaften Remotasks und Outlier für die Datenkennzeichnung. Zum Vorstand und zur Führung von Scale gehörten Persönlichkeiten wie Michael Kratsios, der 2021 beitrat, um die Strategie zu leiten.