Scale AI, Inc. est une entreprise américaine d'infrastructure et de logiciels d'intelligence artificielle basée à San Francisco, en Californie. Initialement axée sur l'annotation de données, l'entreprise propose également des services d'apprentissage par renforcement à partir de retours humains (RLHF), l'évaluation de grands modèles de langage (LLM), et des suites logicielles d'entreprise pour créer et déployer des applications d'IA. Sa branche de recherche, le Safety, Evaluation and Alignment Lab, se concentre sur l'évaluation et l'alignement des LLM, et a co-créé le benchmark Humanity's Last Exam.
Scale AI externalise l'étiquetage de données via ses filiales, Remotasks, qui se concentre sur la vision par ordinateur et les véhicules autonomes, et Outlier, qui se concentre sur l'annotation de données pour les LLM. L'entreprise exploite une équipe rouge LLM qui mène des tests adverses humains pour identifier les vulnérabilités, les biais et les risques de sécurité dans les modèles d'IA, en travaillant avec des organisations telles que OpenAI et Google DeepMind ainsi que des instituts nationaux de sécurité de l'IA. Les clients commerciaux ont inclus Google, Microsoft, Meta, General Motors, OpenAI et Time, tandis que l'entreprise travaille également avec des gouvernements, notamment les États-Unis sur des projets liés au militaire et le Qatar sur l'efficacité des programmes sociaux.
Histoire
Premières années (2016-2019)
Scale a été fondée en 2016 par Alexandr Wang et Lucy Guo via Y Combinator, après que les deux aient travaillé ensemble chez Quora. Les investisseurs initiaux comprenaient Dragoneer Investment Group, Tiger Global Management et Index Ventures. Guo a été licenciée en 2018. En août 2019, après un investissement de 100 millions de dollars du Founders Fund de Peter Thiel, la valorisation de Scale a dépassé 1 milliard de dollars, lui conférant le statut de licorne.
Croissance (2019-2025)
Scale a signé un contrat avec le département de la Défense des États-Unis en 2020. En mai 2021, Michael Kratsios, ancien directeur de la technologie des États-Unis sous l'administration Trump, a rejoint l'entreprise en tant que directeur général et responsable de la stratégie. En juillet 2021, Scale a atteint une valorisation de 7 milliards de dollars après un financement mené par Greenoaks, Dragoneer et Tiger Global, stimulé par une demande accrue d'étiquetage de données dans divers secteurs.
En janvier 2022, Scale a remporté un contrat de 250 millions de dollars pour donner aux agences fédérales américaines accès à sa suite d'outils. En février 2022, elle a développé le service Automated Damage Identification Service en réponse à l'invasion russe de l'Ukraine, analysant des images satellite pour mesurer les dommages aux bâtiments et géolocalisant des rapports pour les groupes humanitaires. En novembre 2022, Scale a été reconnue par Time sur sa liste des meilleures inventions de 2022 et a ouvert un bureau à Saint-Louis.
En janvier 2023, Scale a licencié 20 % de ses effectifs. En mai 2023, elle a signé un accord avec le XVIIIe corps aéroporté de l'armée américaine, devenant la première entreprise d'IA à déployer son LLM, connu sous le nom de Donovan, sur un réseau classifié. En août 2023, Scale est devenue le partenaire privilégié d'OpenAI pour affiner GPT-3.5, et ses services ont été utilisés pour créer ChatGPT. Ce même mois, la plateforme d'évaluation de Scale a été utilisée à DEF CON pour le premier événement d'équipe rouge en IA générative, testant des modèles de diverses entreprises. En décembre 2023, Scale a contribué à l'initiative Purple Llama de Meta, un cadre de sécurité pour les modèles d'IA générative ouverts.
En février 2024, Scale a été sélectionnée par le département de la Défense pour tester et évaluer ses LLM à des fins militaires dans le cadre d'un contrat d'un an. En mars 2024, Scale a atteint une valorisation de près de 13 milliards de dollars après qu'Accel a mené un autre cycle de financement. En mai 2024, elle a levé 1 milliard de dollars supplémentaires avec de nouveaux investisseurs, dont Amazon et Meta, portant sa valorisation à 14 milliards de dollars. En août 2024, Scale a signé un accord avec l'Institut américain de sécurité de l'IA, contrôlé par l'Institut national des normes et de la technologie du département du Commerce, pour collaborer sur la recherche, les tests et l'évaluation.
En décembre 2024, Scale a été poursuivie par un ancien employé alléguant un vol de salaire et une mauvaise classification des travailleurs ; un deuxième employé a déposé une plainte similaire le mois suivant. En janvier 2025, plusieurs sous-traitants ont poursuivi Scale, alléguant un préjudice psychologique dû à l'exposition à du contenu perturbant. Ce mois-là, The Conversation a rapporté que Scale et Meta avaient précédemment collaboré pour créer et vendre Defense Llama, un produit LLM à des fins de défense de type militaire. Scale a également publié une publicité pleine page dans The Washington Post exhortant le président Donald Trump à « gagner la guerre de l'IA ». Plus tard en janvier, Scale et le Center for AI Safety ont publié Humanity's Last Exam, un benchmark pour les systèmes d'IA, et Scale a aidé à développer les benchmarks EnigmaEval, MultiChallenge et MASK.
En février 2025, Scale a convenu d'un partenariat de cinq ans avec le gouvernement qatari pour améliorer les services gouvernementaux via des outils et une formation en IA, y compris l'analyse prédictive, l'automatisation et l'analyse avancée de données, signé au sommet Web Qatar 2025. Toujours en février, Scale est devenue un évaluateur tiers de modèles d'IA pour l'Institut américain de sécurité de l'IA. En mars 2025, Scale a conclu un accord de plusieurs millions de dollars avec le département de la Défense pour développer le projet Thunderforge, une étape majeure dans l'automatisation militaire américaine, visant à utiliser l'IA pour planifier et aider à exécuter les mouvements de navires, d'avions et d'autres actifs. Le contrat, attribué par l'unité d'innovation de la Défense à Scale, Anduril Industries et Microsoft, était destiné à une utilisation initiale avec l'USINDOPACOM et l'EUCOM. En avril 2025, Scale a publié Scale Evaluation, une plateforme pour tester les LLM par rapport à des benchmarks afin d'identifier les faiblesses et de signaler où des données d'entraînement supplémentaires amélioreraient les modèles.
Investissement supplémentaire de Meta (2025)
Le 10 juin 2025, Meta Platforms a accepté d'acheter une participation sans droit de vote de 49 % dans Scale AI pour 14,8 milliards de dollars. L'entreprise est restée une entité autonome et indépendante de Meta. L'ancien PDG Alexandr Wang a pris un poste de haut niveau chez Meta dans le cadre de l'accord et a été remplacé par Jason Droege, directeur de la stratégie de l'entreprise et ancien dirigeant d'Uber.
Scale Labs
En mars 2026, l'entreprise a lancé Scale Lab, une initiative visant à faire progresser la recherche et le développement en IA, bien que les détails spécifiques de ses opérations n'aient pas été largement divulgués à cette époque.
Services et produits
Scale AI fournit une suite d'outils pour l'annotation de données, y compris l'étiquetage d'images, de vidéos et de texte, essentiels pour entraîner des modèles de machine learning. Ses services RLHF aident à aligner les LLM sur les préférences humaines, une étape critique dans le développement de systèmes comme les grands modèles de langage. Les plateformes d'évaluation de l'entreprise, telles que Scale Evaluation, permettent aux organisations de tester les performances des modèles par rapport à des benchmarks, d'identifier les faiblesses et d'améliorer les données d'entraînement. Pour les clients d'entreprise, Scale propose des suites logicielles pour créer et déployer des applications d'IA, y compris des outils de surveillance des modèles et de tests de sécurité.
L'équipe rouge LLM mène des tests adverses pour découvrir les vulnérabilités, les biais et les risques de sécurité, simulant souvent des menaces complexes comme les attaques de cybersécurité, les jailbreaks et les comportements d'IA agentique. Ce travail soutient à la fois les clients commerciaux et les agences gouvernementales, y compris les instituts nationaux de sécurité de l'IA.
Travail gouvernemental et militaire
Scale AI possède un portefeuille important de contrats gouvernementaux. Son travail avec le département de la Défense des États-Unis comprend le projet Thunderforge, qui vise à automatiser la planification et l'exécution militaires, ainsi que des contrats antérieurs pour tester et évaluer les LLM à des fins militaires. L'entreprise a également collaboré avec le gouvernement qatari pour améliorer les programmes sociaux via l'IA, et avec l'Institut américain de sécurité de l'IA pour l'évaluation des modèles. Ces collaborations ont attiré l'attention en raison de préoccupations éthiques concernant l'IA dans des contextes militaires, mais Scale s'est positionnée comme un leader dans le déploiement sûr et aligné de l'IA.
Recherche et benchmarks
Le Safety, Evaluation and Alignment Lab de Scale se concentre sur l'évaluation et l'alignement des LLM, contribuant au développement de benchmarks comme Humanity's Last Exam, qui teste les systèmes d'IA sur une large gamme de tâches de connaissances et de raisonnement. L'entreprise a également aidé à créer EnigmaEval, MultiChallenge et MASK, qui ciblent des capacités spécifiques telles que le raisonnement, la résolution de problèmes en plusieurs étapes et la sécurité. Ces benchmarks sont utilisés par les chercheurs et les développeurs pour évaluer les performances des modèles et guider les améliorations.
Questions juridiques et éthiques
Scale a fait face à des défis juridiques liés aux pratiques de travail. En décembre 2024, un ancien employé a poursuivi l'entreprise pour vol de salaire et mauvaise classification des travailleurs, suivi d'une plainte similaire en janvier 2025. De plus, des sous-traitants ont poursuivi Scale en janvier 2025, alléguant un préjudice psychologique dû à l'exposition à du contenu perturbant lors des tâches d'étiquetage de données. Ces cas mettent en évidence des préoccupations persistantes concernant les conditions de travail des annotateurs de données, qui manipulent souvent du matériel sensible ou traumatique. Scale n'a pas réglé publiquement ces cas au début de 2026.
Direction et structure
Alexandr Wang a cofondé Scale et a occupé le poste de PDG jusqu'en juin 2025, date à laquelle il a quitté l'entreprise pour rejoindre Meta dans le cadre de l'accord d'investissement. Jason Droege, qui avait été directeur de la stratégie et avait précédemment travaillé chez Uber, lui a succédé en tant que PDG. L'entreprise a son siège à San Francisco, en Californie, et exploite les filiales Remotasks et Outlier pour l'étiquetage de données. Le conseil d'administration et la direction de Scale ont inclus des figures comme Michael Kratsios, qui a rejoint l'entreprise en 2021 pour diriger la stratégie.