Neural Magicは、コモディティCPUハードウェア上での機械学習推論を高速化する技術を開発するソフトウェア企業である。2017年に設立され、マサチューセッツ州ボストンに本社を置く同社は、GPUなどの専用アクセラレータを不要にすることで、人工知能の展開をより手頃で費用対効果の高いものにすることに注力している。その中核的なアプローチは、モデルのスパース性と量子化におけるアルゴリズム上の革新と、CPU固有の最適化を組み合わせたものであり、ディープニューラルネットワークを標準的なx86プロセッサ上で効率的に実行することを可能にしている。同社のソリューションは、コンピュータビジョン、自然言語処理、大規模な生成AIワークロードなどのタスクのために、さまざまな業界で使用されている。
同社はMIT CSAILとBAIR (Berkeley AI Research)での研究から生まれたもので、創業者らはニューラルネットワークの数学的構造を活用して計算要求を削減する方法を探求していた。Neural Magicの技術は、多くのニューラルネットワークにかなりの冗長性が含まれており、重みを刈り込んだり量子化したりすることで、はるかに少ない演算で推論を実行できるという観察に基づいている。同社のソフトウェアスタックは、DeepSparseランタイムやSparseMLツールキットを含み、開発者がカスタムハードウェアを必要とせずにモデルを圧縮・高速化することを可能にする。このアプローチにより、Neural MagicはAIインフラストラクチャ分野で注目すべきプレーヤーとして位置づけられており、特にGPUクラスターの高コストや供給制約を回避しようとする組織にとって重要である。
History and Founding
Neural Magicは、機械学習とシステムのバックグラウンドを持つ3人の研究者、Mark Chen、Jakob Uszkoreit、Lukasz Kaiserによって2017年に設立された。UszkoreitとKaiserはGoogleでのトランスフォーマーアーキテクチャへの初期の貢献者であり、Chenは効率的な推論技術に取り組んでいた。3人は、モデルを元のサイズの一部に刈り込んでも精度を維持できることを示したスパースニューラルネットワークに関する研究の商業化を目指した。同社は当初ステルスで運営され、学術論文を発表し中核技術を開発した後、2020年に最初の製品を公開した。
2020年、Neural MagicはDeepSparse推論エンジンをリリースし、CPU上での畳み込みモデルとトランスフォーマーモデルで大幅な高速化を実証した。同社はまた、トレーニング中にモデルにスパース性と量子化を適用するためのオープンソースライブラリであるSparseMLも導入した。これらのリリースは企業やクラウドプロバイダーの注目を集め、インテルやAMDなどの企業とのパートナーシップにつながった。2021年までに、Neural MagicはNEA、Andreessen Horowitz、Pillar VCなどの投資家から5000万ドル以上を調達した。同社は製品ラインを拡大し続け、大規模言語モデル推論のサポートを追加し、PyTorchやHugging Face Transformersなどの人気フレームワークとの統合を進めた。
Technology and Approach
Neural Magicの中核技術は、スパース性と量子化という2つの主要な手法を中心に展開されている。スパース性は、ニューラルネットワークの重みを刈り込み、その多くをゼロに設定することで、推論中に必要な乗算の数を減らすものである。量子化は、重みと活性化の精度を32ビット浮動小数点から8ビット整数に削減し、計算コストとメモリ帯域幅をさらに削減する。同社のソフトウェアはこれらの手法をモデルに自動的に適用し、多くの場合精度の損失を最小限に抑えつつ、ターゲットCPU用に最適化されたコードを生成する。
DeepSparseランタイムは、これらの圧縮モデルを実行するエンジンである。これは、ゼロエントリをスキップするスパース行列乗算と呼ばれる手法を使用し、AVX-512やVNNIなどのCPUベクトル命令を活用して残りの演算を高速化する。ランタイムには、各モデルとハードウェア構成に特化したカーネルを生成するジャストインタイムコンパイラも含まれている。このアプローチにより、Neural Magicは特定のワークロード、特にバッチ推論やリアルタイムアプリケーションにおいて、GPUベースのシステムに匹敵するかそれを上回る推論速度を達成できる。
コンパニオンのトレーニングライブラリであるSparseMLは、モデルのトレーニングまたはファインチューニング中に刈り込みと量子化を適用するためのAPIを提供する。これは、重みをその大きさに基づいて段階的に削除するgradual magnitude pruningと呼ばれる手法と、トレーニング中に低精度演算をシミュレートして精度を維持する量子化対応トレーニングをサポートしている。これらのツールは既存の機械学習パイプラインに簡単に統合できるように設計されており、幅広い開発者がこの技術を利用できるようにしている。
Products and Services
Neural Magicは、DeepSparseとSparseMLのブランドでいくつかの製品を提供している。DeepSparseランタイムはPythonパッケージとDockerコンテナとして利用可能で、CPUとクラウドの両方の展開をサポートしている。REST APIを介してモデルを提供するためのサーバーモードと、推論をアプリケーションに埋め込むためのクライアントライブラリが含まれている。同社はまた、事前に最適化されたモデルズーも提供しており、刈り込みと量子化が施された人気モデルのコレクションがすぐに展開できる状態で用意されている。
SparseMLは、PyTorchとTensorFlowと統合するオープンソースライブラリであり、スパース性と量子化を適用するためのコマンドラインインターフェースとPython APIを提供する。また、残差ネットワークやトランスフォーマーバリアントなどの一般的なモデル向けのレシピも含まれており、刈り込みスケジュールとハイパーパラメータを指定している。さらに、Neural MagicはDeepSparse Cloudと呼ばれるクラウドサービスも提供しており、自動スケーリングを備えた管理型推論エンドポイントを提供していたが、このサービスは後にオンプレミス展開を優先して廃止された。
大規模言語モデル推論については、Neural MagicはLlamaやMistralなどのモデル向けに特化した最適化を開発している。これらの最適化には、KVキャッシュ量子化や融合カーネルが含まれており、メモリ使用量を削減しスループットを向上させる。同社はまた、インテルと協力して、インテルの最新Xeonプロセッサ向けにソフトウェアを最適化し、人気ベンチマークで大幅な性能向上を達成している。
Performance and Benchmarks
Neural Magicは、その技術の有効性を実証するベンチマーク結果を公開している。例えば、デュアルソケットのIntel Xeon Platinum 8380サーバー上で、刈り込みと量子化を施したBERT-largeモデルのバージョンが、最適化されていないベースラインの約200文/秒と比較して、毎秒1,000文以上を達成したと報告している。YOLOv5などのコンピュータビジョンモデルでは、DeepSparseは単一CPUソケットで毎秒100フレームを超えるフレームレートを達成し、多くのアプリケーションでGPU推論に匹敵する性能を示している。
同社はまた、CPUベースの推論のコストメリットも強調している。既存のサーバーインフラストラクチャを使用することで、組織はGPUクラスターへの設備投資を回避し、エネルギー消費を削減できる。Neural Magicの技術は、電力とスペースが限られているエッジ展開や、低レイテンシを必要とするリアルタイムアプリケーションにとって特に魅力的である。
ただし、性能向上はモデルアーキテクチャと達成可能なスパース性の程度に依存する。冗長性が限られた高密度モデルでは改善が小さくなる可能性があり、特に大規模な並列性を必要とする非常に大きなモデルでは、一部のワークロードは依然としてGPUの恩恵を受ける。Neural Magicはこれらの限界を認識しており、CPUアクセラレーションに最適なモデルについてのガイダンスを提供している。
Market Position and Competition
Neural Magicは、ハードウェアとソフトウェアの両方のソリューションを含む、競争の激しいAI推論最適化分野で事業を展開している。ハードウェア面では、エヌビディアなどの企業がGPUで支配的であり、GroqやSambaNovaは専用のAIアクセラレータを提供している。ソフトウェア面では、競合にはOpenAIのTriton、Google DeepMindのJAX、TVMやONNX Runtimeなどのさまざまなコンパイラフレームワークが含まれる。Neural Magicは、データセンターで遍在ししばしば十分に活用されていないCPUにのみ焦点を当てることで差別化を図っている。
同社はまた、専用ハードウェアなしでより小さなモデルを生成できるモデル蒸留や知識蒸留などの新興技術からの競争にも直面している。ただし、Neural Magicのアプローチはこれらの手法と組み合わせることができ、そのツールは既存の最適化ワークフローを補完するように設計されている。
2023年、Neural MagicはIBMの子会社であるred-hatに非公開の金額で買収された。この買収は、Neural Magicの技術をRed HatのOpenShift AIプラットフォームに統合し、顧客にCPUベースの推論オプションを提供することを目的としていた。この動きは、効率的なAI展開に対するエンタープライズソフトウェアベンダーの関心の高まりを示していた。
Use Cases and Applications
Neural Magicの技術は、さまざまな実世界のアプリケーションで使用されている。コンピュータビジョンでは、小売、製造、セキュリティでの使用のために、物体検出、画像分類、セグメンテーションモデルを高速化する。自然言語処理では、感情分析、固有表現認識、質問応答システムを支えている。大規模言語モデルのサポートにより、チャットボットやコード生成ツールをCPUサーバー上に展開することも可能になり、スタートアップや企業のコストを削減している。
注目すべきユースケースの1つは医療分野であり、Neural Magicのソフトウェアは病院のサーバー上で医用画像モデルを実行するために使用され、機密データをクラウドに送信する必要を回避している。金融分野では、低レイテンシを必要とする不正検出やアルゴリズム取引モデルを高速化する。この技術は、CPUが唯一の利用可能な計算リソースであることが多い自動運転車やロボティクスでも使用されている。
Research and Open Source
Neural Magicは活発な研究プログラムを維持しており、スパーストレーニング、量子化、推論最適化に関する論文を発表している。その研究者は、NeurIPS、ICML、MLSysなどの会議に貢献してきた。同社はまた、SparseMLやDeepSparseの一部を含むソフトウェアの多くをオープンソースとしてリリースし、ユーザーと貢献者のコミュニティを育成している。
オープンソース戦略は、Neural Magicが大規模なユーザーベースを構築し、機械学習コミュニティでの信頼性を確立するのに役立っている。開発者はツールを試してプロジェクトに統合でき、同社はコミュニティからのフィードバックと貢献の恩恵を受けている。このアプローチは、Hugging Faceやweights-and-biasesなどの他のAIインフラストラクチャ企業と同様である。
Future Directions
今後、Neural Magicは新興のモデルアーキテクチャとハードウェアへのサポートを拡大することを目指している。トランスフォーマーベースのモデルと生成AIの台頭に伴い、同社は大規模言語モデル推論の最適化に投資しており、投機的デコードや動的バッチ処理などの手法を含む。また、クラウド環境で人気が高まっているARMプロセッサやAMD EPYC CPUのサポートも模索している。
AIモデルがより大きく複雑になるにつれて、効率的な推論の必要性はさらに高まるだろう。Neural MagicのCPUへの焦点は、組織が性能、コスト、エネルギー消費のバランスを取ろうとする中で、ますます重要になる可能性がある。Red HatとIBMとの統合はエンタープライズ採用への道筋を提供し、オープンソースエコシステムは開発者を引き付け続けている。
Conclusion
Neural Magicは、CPUベースの推論最適化のパイオニアとしての地位を確立し、GPU中心のアプローチに代わる魅力的な選択肢を提供している。スパース性、量子化、ランタイムエンジニアリングの組み合わせにより、コモディティハードウェア上で大幅な性能向上を実現し、AIをより利用しやすく手頃なものにしている。特定のワークロードに対するCPUの固有の制限などの課題は残るものの、同社の技術は複数の業界で価値があることが証明されている。Red HatとIBMの支援を受けて、Neural MagicはAI展開の未来において重要な役割を果たす好位置にある。