Neural Magic는 머신러닝 추론을 일반 범용 CPU 하드웨어에서 가속화하는 소프트웨어를 개발하는 회사입니다. 2017년에 설립되어 매사추세츠주 보스턴에 본사를 두고 있으며, GPU와 같은 특수 가속기 없이도 인공지능 배포를 더욱 접근 가능하고 비용 효율적으로 만드는 데 주력하고 있습니다. 이 회사의 핵심 접근 방식은 모델 희소성과 양자화에 대한 알고리즘 혁신을 CPU 특화 최적화와 결합하여 딥 뉴럴 네트워크가 표준 x86 프로세서에서 효율적으로 실행될 수 있도록 하는 것입니다. 이 회사의 솔루션은 컴퓨터 비전, 자연어 처리, 대규모 생성형 AI 워크로드 등 다양한 산업 분야에서 사용됩니다.
이 회사는 MIT 컴퓨터 과학 및 인공지능 연구소와 버클리 인공지능 연구소의 연구에서 시작되었으며, 창립자들은 신경망의 수학적 구조를 활용하여 계산 요구 사항을 줄이는 방법을 모색했습니다. Neural Magic의 기술은 많은 신경망에 상당한 중복성이 포함되어 있으며, 가지치기와 양자화를 통해 훨씬 적은 연산으로 추론을 수행할 수 있다는 관찰에 기반합니다. DeepSparse 런타임 및 SparseML 툴킷을 포함한 이 회사의 소프트웨어 스택은 맞춤형 하드웨어 없이도 모델을 압축하고 가속화할 수 있게 해줍니다. 이 접근 방식은 GPU 클러스터의 높은 비용과 공급 제약을 피하려는 조직, 특히 AI 인프라 분야에서 Neural Magic을 주목할 만한 업체로 자리매김하게 했습니다.
역사 및 설립 배경
Neural Magic은 머신러닝과 시스템 분야에서 경력을 쌓은 연구원들인 마크 첸, 야쿠프 우스키오레이트, 우카시 카이저에 의해 2017년에 설립되었습니다. 우스키오레이트와 카이저는 Google에서 트랜스포머 아키텍처에 초기 기여자였으며, 첸은 효율적인 추론 기술에 대해 연구했습니다. 이 세 사람은 희소 신경망에 대한 연구가 모델을 원래 크기의 일부로 줄이면서도 정확도를 유지할 수 있음을 보여줄 수 있다는 것을 목표로 했습니다. 이 회사는 처음에는 비공개로 운영되며 학술 논문을 발표하고 핵심 기술을 개발하다가 2020년에 첫 제품을 공개적으로 출시했습니다.
2020년, Neural Magic은 트랜스포머 및 컨볼루션 모델에 대해 CPU에서 상당한 속도 향상을 보여주는 DeepSparse 추론 엔진을 출시했습니다. 또한 훈련 중 모델에 희소성과 양자화를 적용하기 위한 오픈소스 라이브러리인 SparseML도 도입했습니다. 이러한 출시는 인텔 및 AMD와 같은 기업과의 파트너십을 포함하여 엔터프라이즈 및 클라우드 제공업체의 관심을 끌었습니다. 2021년까지 Neural Magic은 NEA, Andreessen Horowitz, Pillar VC를 포함한 투자자들로부터 5천만 달러 이상의 자금을 조달했습니다. 이 회사는 제품 라인을 계속 확장하여 대규모 언어 모델 추론에 대한 지원을 추가하고 PyTorch 및 Hugging Face Transformers와 같은 인기 있는 프레임워크와 통합했습니다.
기술 및 접근 방식
Neural Magic의 핵심 기술은 희소성과 양자화라는 두 가지 주요 기법을 중심으로 이루어집니다. 희소성은 신경망의 많은 가중치를 0으로 설정하여 추론 중에 필요한 곱셈 횟수를 줄이는 가지치기 과정을 포함합니다. 양자화는 가중치와 활성화의 정밀도를 32비트 부동 소수점에서 8비트 정수로 줄여 계산 비용과 메모리 대역폭을 추가로 절감합니다. 이 회사의 소프트웨어는 이러한 기법을 모델에 자동으로 적용하고 정확도 손실을 최소화한 다음 대상 CPU에 최적화된 코드를 생성합니다.
DeepSparse 런타임은 이러한 압축 모델을 실행하는 엔진입니다. 이 런타임은 0 항목을 건너뛰는 희소 행렬 곱셈이라는 기술을 사용하며, AVX-512 및 VNNI와 같은 CPU 벡터 명령어를 활용하여 남은 연산을 가속화합니다. 또한 각 모델 및 하드웨어 구성에 대해 특수 커널을 생성하는 JIT(Just-In-Time) 컴파일러도 포함되어 있습니다. 이 접근 방식을 통해 Neural Magic은 특히 배치 추론 및 실시간 애플리케이션의 특정 워크로드에 대해 GPU 기반 시스템과 견줄 수 있거나 능가하는 추론 속도를 달성할 수 있습니다.
동반 훈련 라이브러리인 SparseML은 모델 훈련 또는 미세 조정 중에 가지치기 및 양자화를 위한 API를 제공합니다. 이 라이브러리는 가중치 크기에 따라 점진적으로 제거하는 점진적 가지치기와 훈련 중 저정밀 산술을 시뮬레이션하여 정확도를 보존하는 양자화 인지 훈련과 같은 기술을 지원합니다. 이러한 도구는 기존 머신러닝 파이프라인에 쉽게 통합되도록 설계되어 기술을 다양한 개발자에게 제공합니다.
제품 및 서비스
Neural Magic은 DeepSparse 및 SparseML 브랜드로 여러 제품을 제공합니다. DeepSparse 런타임은 Python 패키지 및 Docker 컨테이너로 제공되며 CPU 및 클라우드 배포를 모두 지원합니다. REST API를 통해 모델을 제공하기 위한 서버 모드와 애플리케이션에 추론을 포함하기 위한 클라이언트 라이브러리가 포함되어 있습니다. 이 회사는 또한 사전 최적화된 모델 컬렉션인 모델 저장소를 제공하며, 여기에는 가지치기 및 양자화되어 즉시 배포할 수 있는 인기 있는 모델이 포함되어 있습니다.
SparseML은 PyTorch 및 TensorFlow와 통합되는 오픈소스 라이브러리로, 희소성 및 양자화 적용을 위한 명령줄 인터페이스와 Python API를 제공합니다. 또한 레즈넷 및 트랜스포머 변형과 같은 일반적인 모델에 대한 레시피가 포함되어 있으며, 가지치기 일정 및 하이퍼파라미터를 지정합니다. 또한 Neural Magic은 DeepSparse Cloud라는 클라우드 서비스를 제공하며, 이 서비스는 자동 확장 기능이 있는 관리형 추론 엔드포인트를 제공하지만 이 서비스는 이후 온프레미스 배포를 위해 중단되었습니다.
대규모 언어 모델 추론을 위해 Neural Magic은 Llama 및 Mistral과 같은 모델에 대한 특수 최적화를 개발했습니다. 이러한 최적화에는 KV 캐시 양자화 및 융합 커널이 포함되어 메모리 사용량을 줄이고 처리량을 향상시킵니다. 이 회사는 또한 최신 Xeon 프로세서에서 소프트웨어를 최적화하기 위해 인텔과 협력하여 인기 있는 벤치마크에서 상당한 성능 향상을 달성했습니다.
성능 및 벤치마크
Neural Magic은 기술의 효과를 입증하는 벤치마크 결과를 게시합니다. 예를 들어, 듀얼 소켓 Intel Xeon Platinum 8380 서버에서 이 회사는 BERT-large 모델의 가지치기 및 양자화 버전이 초당 1,000개 이상의 문장을 처리할 수 있다고 보고했으며, 이는 최적화되지 않은 기준선의 약 200개에 비해 크게 향상된 수치입니다. 컴퓨터 비전 모델의 경우 DeepSparse는 YOLOv5와 같은 모델에서 단일 CPU 소켓에서 초당 100프레임 이상을 달성하여 많은 애플리케이션에서 GPU와 경쟁력이 있음을 입증했습니다.
이 회사는 또한 CPU 기반 추론의 비용 이점을 강조합니다. 기존 서버 인프라를 활용함으로써 조직은 GPU 클러스터의 자본 지출을 피하고 에너지 소비를 줄일 수 있습니다. Neural Magic의 기술은 전력과 공간이 제한된 엣지 배포와 낮은 대기 시간이 필요한 실시간 애플리케이션에 특히 매력적입니다.
그러나 성능 향상은 모델 아키텍처와 달성 가능한 희소성 수준에 따라 달라집니다. 중복성이 제한된 밀집 모델은 개선 폭이 작을 수 있으며, 일부 워크로드는 특히 매우 큰 모델과 대규모 병렬 처리가 필요한 작업의 경우 GPU의 이점을 계속 누릴 수 있습니다. Neural Magic은 이러한 한계를 인식하고 CPU 가속에 가장 적합한 모델에 대한 지침을 제공합니다.
시장 위치 및 경쟁
Neural Magic은 AI 추론 최적화 분야에서 경쟁이 치열한 환경에서 운영됩니다. 하드웨어 측면에서 엔비디아는 GPU로 시장을 지배하고 있으며, 그록 및 삼바노바와 같은 회사는 특수 AI 가속기를 제공합니다. 소프트웨어 측면에서 경쟁사로는 오픈AI의 Triton, 구글 딥마인드의 JAX, TVM 및 ONNX Runtime과 같은 다양한 컴파일러 프레임워크가 있습니다. Neural Magic은 유비쿼터스하고 데이터 센터에서 종종 활용도가 낮은 CPU에만 집중함으로써 차별화합니다.
이 회사는 또한 지식 증류와 같은 신흥 기술과 경쟁하고 있으며, 이는 특수 하드웨어 없이도 더 작은 모델을 생성할 수 있습니다. 그러나 Neural Magic의 접근 방식은 이러한 방법과 결합될 수 있으며, 이 회사의 도구는 기존 최적화 워크플로우를 보완하도록 설계되었습니다.
2023년, Neural Magic은 IBM의 자회사인 레드햇에 인수되었습니다. 인수 금액은 공개되지 않았습니다. 이번 인수는 Neural Magic의 기술을 레드햇의 OpenShift AI 플랫폼에 통합하여 고객에게 CPU 기반 추론 옵션을 제공하는 것을 목표로 했습니다. 이 움직임은 엔터프라이즈 소프트웨어 공급업체의 효율적인 AI 배포에 대한 관심이 높아지고 있음을 보여줍니다.
사용 사례 및 응용 분야
Neural Magic의 기술은 다양한 실제 애플리케이션에서 사용됩니다. 컴퓨터 비전 분야에서는 소매, 제조 및 보안 산업에서 객체 감지, 이미지 분류 및 분할 모델을 가속화합니다. 자연어 처리에서는 감정 분석, 명명된 엔터티 인식 및 질문 응답 시스템을 지원합니다. 대규모 언어 모델에 대한 지원은 코드 생성 및 챗봇 애플리케이션을 포함한 배포를 가능하게 하여 CPU 서버에서 비용 효율적으로 실행할 수 있습니다.
주목할 만한 사용 사례 중 하나는 의료 분야로, Neural Magic의 소프트웨어는 민감한 데이터를 클라우드로 보내지 않고도 병원 서버에서 의료 영상 모델을 실행하는 데 사용되었습니다. 금융 분야에서는 낮은 대기 시간이 필요한 사기 탐지 및 알고리즘 거래 모델을 가속화합니다. 이 기술은 자율 주행 차량과 로봇 공학에도 사용되며, CPU가 유일하게 사용 가능한 컴퓨팅 리소스인 경우가 많습니다.
연구 및 오픈소스
Neural Magic은 희소성, 양자화 및 추론 최적화에 관한 연구 논문을 발표하면서 활발한 연구 프로그램을 유지하고 있습니다. 이 회사의 연구원들은 NeurIPS, ICML 및 MLSys와 같은 컨퍼런스에 기여했습니다. 또한 SparseML 및 DeepSparse의 일부를 포함하여 소프트웨어의 많은 부분을 오픈소스로 공개하여 사용자와 기여자 커뮤니티를 조성했습니다.
오픈소스 전략은 Neural Magic이 머신러닝 커뮤니티 내에서 신뢰를 구축하고 채택을 주도하는 데 도움이 되었습니다. 개발자는 도구를 실험하고 프로젝트에 통합할 수 있으며, 회사는 커뮤니티 피드백과 기여의 이점을 얻습니다. 이 접근 방식은 허깅페이스 및 Weights & Biases와 같은 다른 AI 인프라 회사의 전략과 유사합니다.
향후 방향
앞으로 Neural Magic은 새로운 모델 아키텍처와 하드웨어에 대한 지원을 확장하는 것을 목표로 합니다. 트랜스포머 기반 모델과 생성형 AI의 부상으로 이 회사는 추측 디코딩 및 동적 배칭과 같은 기술을 포함하여 대규모 언어 모델 추론을 위한 최적화에 투자하고 있습니다. 또한 클라우드 환경에서 인기를 얻고 있는 ARM 홀딩스 프로세서 및 AMD EPYC CPU에 대한 지원도 모색하고 있습니다.
AI 모델이 점점 더 커지고 복잡해짐에 따라 효율적인 추론에 대한 필요성은 더욱 커질 것입니다. 조직이 성능, 비용 및 에너지 소비의 균형을 추구함에 따라 CPU에 대한 Neural Magic의 집중은 점점 더 관련성이 높아질 수 있습니다. 레드햇 및 IBM과의 통합은 엔터프라이즈 채택을 위한 경로를 제공하며, 이 회사의 오픈소스 생태계는 계속해서 개발자를 유치하고 있습니다.
결론
Neural Magic은 GPU 중심 접근 방식에 대한 매력적인 대안을 제공하는 CPU 기반 추론 최적화 분야의 선구자로 자리매김했습니다. 희소성, 양자화 및 런타임 엔지니어링의 결합은 범용 하드웨어에서 상당한 성능 향상을 제공하여 AI를 더욱 접근 가능하고 저렴하게 만듭니다. 특정 워크로드에 대한 CPU의 고유한 한계와 같은 과제가 남아 있지만, 이 회사의 기술은 여러 산업 분야에서 가치가 입증되었습니다. 레드햇과 IBM의 지원으로 Neural Magic은 AI 배포의 미래에서 중요한 역할을 할 준비가 되어 있습니다.