Scale AI, Inc.는 캘리포니아주 샌프란시스코에 본사를 둔 미국의 인공지능 인프라 및 소프트웨어 기업이다. 원래 데이터 주석에 초점을 맞췄던 이 회사는 인간 피드백 기반 강화 학습(RLHF) 서비스, 대규모 언어 모델(LLM) 평가, AI 애플리케이션 구축 및 배포를 위한 엔터프라이즈 소프트웨어 제품군도 제공한다. 연구 부서인 안전, 평가 및 정렬 연구소는 LLM 평가와 정렬에 중점을 두며, 벤치마크인 Humanity's Last Exam을 공동 개발했다.
Scale AI는 자회사인 Remotasks와 Outlier를 통해 데이터 라벨링을 아웃소싱한다. Remotasks는 컴퓨터 비전과 자율 주행 차량에, Outlier는 LLM용 데이터 주석에 초점을 맞춘다. 이 회사는 LLM 레드 팀을 운영하여 인간의 적대적 테스트를 통해 AI 모델의 취약점, 편향, 안전 위험을 식별하며, OpenAI 및 Google DeepMind와 같은 조직 및 국가 AI 안전 연구소와 협력한다. 상업 고객으로는 Google, Microsoft, Meta, General Motors, OpenAI, Time이 포함되었으며, 군사 관련 프로젝트를 위한 미국 정부 및 사회 프로그램 효율성을 위한 카타르 정부와도 협력한다.
역사
초기 (2016–2019)
Scale은 2016년 Alexandr Wang과 Lucy Guo가 Y Combinator를 통해 설립했으며, 두 사람은 Quora에서 함께 일한 경력이 있었다. 초기 투자자로는 Dragoneer Investment Group, Tiger Global Management, Index Ventures가 포함되었다. Guo는 2018년에 해고되었다. 2019년 8월, Peter Thiel의 Founders Fund가 1억 달러를 투자한 후 Scale의 가치는 10억 달러를 초과하여 유니콘 지위를 얻었다.
성장 (2019–2025)
Scale은 2020년 미국 국방부와 계약을 체결했다. 2021년 5월, 트럼프 행정부 시절 미국 최고 기술 책임자였던 Michael Kratsios가 전무 이사 겸 전략 책임자로 합류했다. 2021년 7월까지 Scale은 Greenoaks, Dragoneer, Tiger Global이 주도한 자금 조달로 가치 70억 달러에 도달했으며, 이는 산업 전반의 데이터 라벨링 수요 증가에 따른 것이었다.
2022년 1월, Scale은 미국 연방 기관에 자사 도구 제품군에 대한 접근 권한을 제공하는 2억 5천만 달러 계약을 수주했다. 2022년 2월, 러시아의 우크라이나 침공에 대응하여 위성 이미지를 분석해 건물 피해를 측정하고 인도주의 단체를 위한 지리 태그 보고서를 제공하는 자동 피해 식별 서비스를 개발했다. 2022년 11월, Scale은 Time의 2022년 최고 발명품 목록에 선정되었고 세인트루이스에 사무소를 열었다.
2023년 1월, Scale은 인력의 20%를 해고했다. 2023년 5월, 미 육군 제18공수군단과 계약을 체결하여 분류 네트워크에 LLM인 Donovan을 배포한 최초의 AI 기업이 되었다. 2023년 8월, Scale은 OpenAI의 GPT-3.5 미세 조정을 위한 선호 파트너가 되었으며, 그 서비스는 ChatGPT를 만드는 데 사용되었다. 같은 달, Scale의 평가 플랫폼은 DEF CON에서 첫 생성형 AI 레드 팀 이벤트에 사용되어 다양한 기업의 모델을 테스트했다. 2023년 12월, Scale은 개방형 생성형 AI 모델을 위한 보안 프레임워크인 Meta의 Purple Llama 이니셔티브에 기여했다.
2024년 2월, Scale은 국방부로부터 군사 목적의 LLM 테스트 및 평가를 위한 1년 계약을 수주했다. 2024년 3월, Scale은 Accel이 주도한 추가 자금 조달로 가치가 약 130억 달러에 도달했다. 2024년 5월, Amazon과 Meta를 포함한 신규 투자자로부터 추가 10억 달러를 모금하여 가치가 140억 달러로 상승했다. 2024년 8월, Scale은 상무부 산하 국립표준기술연구소가 관리하는 미국 AI 안전 연구소와 연구, 테스트, 평가 협력을 위한 계약을 체결했다.
2024년 12월, Scale은 임금 절도와 근로자 오분류를 주장하는 전 직원으로부터 소송을 당했으며, 다음 달 두 번째 직원이 유사한 소송을 제기했다. 2025년 1월, 여러 계약자가 충격적인 콘텐츠 노출로 인한 심리적 피해를 주장하며 Scale을 고소했다. 그 달, The Conversation은 Scale과 Meta가 이전에 군사적 방어 목적의 LLM 제품인 Defense Llama를 만들고 판매하기 위해 협력했다고 보도했다. Scale은 또한 The Washington Post에 전면 광고를 내어 도널드 트럼프 대통령에게 "AI 전쟁에서 승리하라"고 호소했다. 1월 말, Scale과 AI 안전 센터는 AI 시스템용 벤치마크인 Humanity's Last Exam을 공개했으며, Scale은 EnigmaEval, MultiChallenge, MASK 벤치마크 개발을 지원했다.
2025년 2월, Scale은 Web Qatar 2025 정상 회담에서 서명된 예측 분석, 자동화, 고급 데이터 분석을 포함한 AI 도구와 교육을 통해 정부 서비스를 개선하기 위해 카타르 정부와 5년 파트너십을 체결했다. 또한 2월에 Scale은 미국 AI 안전 연구소의 AI 모델 제3자 평가 기관이 되었다. 2025년 3월, Scale은 미군 자동화의 주요 단계인 Thunderforge 프로젝트 개발을 위해 국방부와 수백만 달러 규모의 계약을 체결했으며, 이는 AI를 사용하여 선박, 항공기 및 기타 자산의 이동을 계획하고 실행을 지원하는 것을 목표로 했다. 이 계약은 국방 혁신 부서가 Scale, Anduril Industries, Microsoft에 수여했으며, 초기에는 미국 인도태평양 사령부와 유럽 사령부에서 사용될 예정이었다. 2025년 4월, Scale은 벤치마크에 대해 LLM을 테스트하여 약점을 식별하고 추가 훈련 데이터가 모델을 개선할 수 있는 위치를 표시하는 플랫폼인 Scale Evaluation을 출시했다.
Meta의 추가 투자 (2025)
2025년 6월 10일, Meta Platforms는 Scale AI의 의결권 없는 지분 49%를 148억 달러에 매수하기로 합의했다. 회사는 Meta와 별개의 독립 법인으로 유지되었다. 전 CEO Alexandr Wang은 거래의 일환으로 Meta 내에서 최고 직책을 맡았으며, 회사의 최고 전략 책임자이자 전 Uber 임원인 Jason Droege가 그를 대체했다.
Scale Labs
2026년 3월, 회사는 AI 연구 및 개발을 촉진하기 위한 이니셔티브인 Scale Lab을 출시했지만, 그 운영에 대한 구체적인 세부 사항은 당시 널리 공개되지 않았다.
서비스 및 제품
Scale AI는 머신 러닝 모델 훈련에 필수적인 이미지, 비디오, 텍스트 라벨링을 포함한 데이터 주석 도구 제품군을 제공한다. RLHF 서비스는 대규모 언어 모델과 같은 시스템 개발의 중요한 단계인 인간 선호도에 LLM을 정렬하는 데 도움을 준다. Scale Evaluation과 같은 회사의 평가 플랫폼은 조직이 벤치마크에 대해 모델 성능을 테스트하고, 약점을 식별하며, 훈련 데이터를 개선할 수 있게 한다. 엔터프라이즈 고객을 위해 Scale은 모델 모니터링 및 안전 테스트 도구를 포함한 AI 애플리케이션 구축 및 배포용 소프트웨어 제품군을 제공한다.
LLM 레드 팀은 사이버 보안 공격, 탈옥, 에이전트형 AI 행동과 같은 복잡한 위협을 시뮬레이션하여 취약점, 편향, 안전 위험을 발견하기 위한 적대적 테스트를 수행한다. 이 작업은 상업 고객과 국가 AI 안전 연구소를 포함한 정부 기관을 모두 지원한다.
정부 및 군사 업무
Scale AI는 상당한 정부 계약 포트폴리오를 보유하고 있다. 미국 국방부와의 작업에는 군사 계획 및 실행 자동화를 목표로 하는 Thunderforge 프로젝트와 군사 목적의 LLM 테스트 및 평가를 위한 초기 계약이 포함된다. 회사는 또한 AI를 통한 사회 프로그램 강화를 위해 카타르 정부 및 모델 평가를 위해 미국 AI 안전 연구소와 파트너십을 맺었다. 이러한 협력은 군사 맥락에서 AI에 대한 윤리적 우려로 주목을 받았지만, Scale은 안전하고 정렬된 AI 배포의 선도자로 자리매김했다.
연구 및 벤치마크
Scale의 안전, 평가 및 정렬 연구소는 LLM 평가와 정렬에 중점을 두며, 광범위한 지식 및 추론 작업에서 AI 시스템을 테스트하는 Humanity's Last Exam과 같은 벤치마크 개발에 기여한다. 회사는 또한 추론, 다단계 문제 해결, 안전과 같은 특정 능력을 대상으로 하는 EnigmaEval, MultiChallenge, MASK를 만드는 데 지원했다. 이러한 벤치마크는 연구자와 개발자가 모델 성능을 평가하고 개선을 안내하는 데 사용된다.
법적 및 윤리적 문제
Scale은 노동 관행과 관련된 법적 문제에 직면했다. 2024년 12월, 전 직원이 임금 절도와 근로자 오분류로 회사를 고소했으며, 2025년 1월 유사한 소송이 이어졌다. 또한 2025년 1월, 계약자들은 데이터 라벨링 작업 중 충격적인 콘텐츠 노출로 인한 심리적 피해를 주장하며 Scale을 고소했다. 이러한 사례는 종종 민감하거나 충격적인 자료를 처리하는 데이터 주석자의 근무 조건에 대한 지속적인 우려를 강조한다. Scale은 2026년 초 현재 이러한 사건을 공개적으로 해결하지 않았다.
리더십 및 구조
Alexandr Wang은 Scale을 공동 설립하고 2025년 6월까지 CEO로 재직했으며, 그 후 투자 계약의 일환으로 Meta에 합류하기 위해 떠났다. 최고 전략 책임자였고 이전에 Uber에서 근무한 Jason Droege가 CEO로 그를 계승했다. 회사는 캘리포니아주 샌프란시스코에 본사를 두고 있으며, 데이터 라벨링을 위해 Remotasks와 Outlier 자회사를 운영한다. Scale의 이사회와 리더십에는 2021년 전략을 이끌기 위해 합류한 Michael Kratsios와 같은 인물이 포함되어 있다.