OctoML은 기계 학습 모델 배포 최적화를 전문으로 하는 기술 기업이다. 2019년 컴퓨터 과학자 Luis Ceze가 설립했으며, 다양한 하드웨어 플랫폼에서 기계 학습 모델 실행을 가속화하고 간소화하는 도구를 개발했다. 2024년 OctoML은 OctoAI로 이름을 변경했고, 이후 Nvidia에 인수되어 해당 기술은 Nvidia의 AI 시스템 소프트웨어 스택의 일부가 되었다.
이 회사의 핵심 초점은 프로덕션 환경에서 딥 러닝 모델 배포의 복잡성을 해결하는 것이었다. OctoML의 플랫폼은 신경망 최적화를 위한 오픈소스 컴파일러 프레임워크인 Apache TVM을 활용하여 특정 하드웨어에 맞게 모델을 자동으로 튜닝함으로써 지연 시간과 비용을 줄였다. 이는 회사를 더 넓은 인공 지능 인프라 생태계 내에 위치시키며, 다른 최적화 및 클라우드 서비스와 경쟁하게 했다.
설립 및 초기 개발
OctoML은 2019년 워싱턴 대학교 교수이자 컴퓨터 아키텍처 및 기계 학습 시스템 연구로 알려진 Luis Ceze에 의해 설립되었다. Ceze는 Apache TVM 개발에 기여한 Thierry Moreau와 Jared Roesch를 포함한 대학교의 다른 연구자들과 함께 회사를 공동 설립했다. 회사는 워싱턴주 시애틀에 본사를 두었으며, Ceze가 2018년부터 벤처 파트너로 활동한 Madrona Venture Group을 포함한 벤처 캐피털 회사들로부터 초기 자금을 받았다.
설립 팀은 워싱턴 대학교 및 다른 기관에서 개발된 Apache TVM의 연구를 상용화하는 것을 목표로 했다. 회사의 초기 제품은 Intel CPU, AMD GPU, ARM 기반 프로세서와 같은 다양한 하드웨어에 맞게 기계 학습 모델을 최적화하는 프로세스를 자동화하는 데 초점을 맞췄다. 이는 기업들이 각 배포 환경에 맞게 모델을 수동으로 튜닝하는 시간 소모적인 작업을 피할 수 있도록 돕기 위한 것이었다.
제품 발전 및 OctoAI로의 이름 변경
2023년 6월, OctoML은 대규모 언어 모델 및 기타 생성형 AI 애플리케이션의 배포를 간소화하도록 설계된 생성형 AI 제품인 OctoAI를 출시했다. OctoAI는 개발자가 Llama 및 Stable Diffusion과 같은 모델을 최적화된 성능으로 실행하고 확장할 수 있게 해주는 관리형 플랫폼을 제공했다. 2024년 1월까지 회사는 이름을 OctoAI로 변경했으며, Ceze는 이 변경이 "제품과 회사 이름 사이의 잠재적 혼동을 없애기 위한 것"이라고 설명했다. 당시 Ceze는 OctoAI에 수천 명의 사용자가 있다고 밝혔다.
2024년 6월, OctoAI는 고객이 특정 사용 사례에 맞게 AI 모델을 맞춤화할 수 있도록 돕는 제품인 OctoStack을 출시했다. OctoStack은 엔터프라이즈급 보안과 확장성을 갖춘 모델 미세 조정 및 서빙 도구를 제공했다. 이러한 제품들은 OctoAI를 성장하는 AI 인프라 시장의 핵심 플레이어로 자리매김하게 했으며, Amazon Web Services, Google Cloud, Azure의 제품과 경쟁했다.
Nvidia에 의한 인수
2024년 9월, The Information은 Nvidia가 약 1억 6500만 달러에 OctoAI 인수를 고려하고 있다고 보도했다. 인수는 2024년 9월 25일에 완료되었다. 인수 후 Luis Ceze는 Nvidia의 AI 시스템 소프트웨어 부사장이 되었으며, 워싱턴 대학교에서의 학문적 직위도 유지했다. 이번 인수는 Nvidia GPU 및 CUDA 소프트웨어와 같은 하드웨어 제품을 보완하는 AI 배포용 소프트웨어 생태계를 강화하려는 Nvidia의 더 넓은 전략의 일부였다.
이번 인수는 Madrona Venture Group, Amplify Partners, Tiger Global Management를 포함한 투자자들로부터 1억 3000만 달러 이상의 자금을 조달한 OctoML에게 중요한 이정표였다. 회사의 기술은 Nvidia의 AI 소프트웨어 스택에 통합되어 Nvidia 하드웨어에서 모델을 최적화하려는 Nvidia 고객에게 잠재적으로 혜택을 줄 수 있었다.
기술 및 영향
OctoML의 핵심 기술은 다양한 하드웨어에서 모델을 효율적으로 실행할 수 있게 해주는 오픈소스 딥 러닝 컴파일러인 Apache TVM을 기반으로 했다. 회사의 플랫폼은 양자화, 가지치기, 연산자 융합을 포함한 모델 최적화 프로세스를 자동화했으며, 이는 추론 지연 시간과 비용을 크게 줄일 수 있었다. 이는 계산 요구가 높은 대규모 언어 모델 배포에서 특히 관련이 있었다.
OctoML의 도구는 의료, 금융, 전자상거래를 포함한 다양한 분야의 기업들이 AI 애플리케이션을 대규모로 배포하는 데 사용되었다. 회사는 또한 오픈소스 커뮤니티에 기여했으며, 엔지니어들이 Apache TVM 및 관련 프로젝트를 적극적으로 유지 관리했다. 모델 최적화를 더 접근 가능하게 만듦으로써 OctoML은 AI 배포를 민주화하여 소규모 기업이 전문 지식 없이도 고급 기계 학습을 활용할 수 있도록 도왔다.
유산 및 미래
인수 후 OctoAI의 제품은 Nvidia 브랜드로 계속 제공되며, Nvidia의 AI 플랫폼과의 통합에 초점을 맞추고 있다. 회사의 기술은 AI 개발 및 배포를 위한 종단 간 솔루션을 제공하려는 Nvidia의 노력에서 역할을 할 것으로 예상된다. 이번 인수는 하드웨어만으로는 최적의 성능을 달성하기에 충분하지 않기 때문에 AI 산업에서 소프트웨어 최적화의 중요성이 커지고 있음을 강조했다.
Luis Ceze의 OctoML 및 Apache TVM에 대한 작업은 2022년 ACM 펠로우 및 2020년 Maurice Wilkes 상을 포함한 수많은 상으로 인정받았다. 컴퓨터 과학 및 AI 시스템에 대한 그의 기여는 학계와 산업계 모두에 계속 영향을 미치고 있다.