Modularは、2022年にChris LattnerとTim Davisによって設立されたソフトウェア企業であり、多様なハードウェア上で機械学習モデルを最適化・展開するために設計されたAI推論ランタイムおよびコンパイラであるMAXプラットフォームの開発で知られている。同社は、AIインフラストラクチャの断片化に対処することを目指し、CPU、GPU、専用アクセラレータを含む複数のバックエンドをサポートする統合ランタイムを提供し、モデルの書き換えを不要とする。Modularの技術は、従来の推論スタックに代わる高性能な選択肢として位置づけられており、大規模言語モデルやその他の深層学習ワークロードにおけるレイテンシ削減とリソース利用効率の向上に焦点を当てている。
同社は、より広範なAIエコシステムから生まれ、LattnerがSwiftプログラミング言語の生みの親であり、機械学習フレームワークで広く使用されるコンパイラ基盤であるLLVMでの経験を活用している。Modularの中核製品であるMAXには、グラフコンパイラ、ランタイム、および開発者がエッジデバイス、データセンター、クラウドプラットフォーム上でモデルを効率的に展開できるようにする一連のAPIが含まれている。2024年時点で、Modularはそのパフォーマンスベンチマークで注目を集めており、特定の推論シナリオにおいてTensorFlowやPyTorchなどの既存ランタイムよりも大幅な高速化を主張している。
資金調達と成長
Modularは2022年にGeneral Catalystが主導するシリーズAラウンドで1億ドルを調達し、GV(Google Ventures)やSV Angelなどの投資家が参加した。このラウンドで同社は約6億ドルと評価され、その技術的アプローチに対する投資家の強い信頼を反映している。この資金は、エンジニアリングチームの拡大、製品開発の加速、ハードウェアベンダーやクラウドプロバイダーとのパートナーシップ構築に充てられた。2023年、ModularはNvidiaとAMDからの追加の戦略的投資を発表したが、具体的な金額は非開示であり、それぞれのGPUアーキテクチャとの互換性を強化することを目的としている。
2024年初頭までに、Modularは100人以上の従業員に成長し、サンフランシスコとニューヨークにオフィスを構えた。同社はまた、2024年3月にMAXのパブリックベータを開始し、開発者が実世界のワークロードでランタイムをテストできるようにした。ベータリリースには、Transformerモデル、動的シェイプを持つニューラルネットワーク、およびHugging FaceのTransformersライブラリなどの人気フレームワークとの統合のサポートが含まれていた。
技術アーキテクチャ
MAXプラットフォームは、Modular独自のコンパイラ技術に基づいており、多層中間表現(IR)を使用して特定のハードウェア向けに計算を最適化する。事前コンパイルされたカーネルに依存する従来のランタイムとは異なり、MAXはジャストインタイム(JIT)コンパイルを実行し、入力シェイプやハードウェア機能に基づく適応的最適化を可能にする。このアプローチはメモリオーバーヘッドを削減し、キャッシュ効率を向上させる。これは、可変バッチサイズの推論タスクにとって重要である。
MAXの主要な特徴は、x86およびARM CPU、Nvidia GPU、そしてCerebrasやGroqなどの新興アクセラレータを含む複数のバックエンドのサポートである。Modularはまた、Intelと提携してIntelのGaudiアクセラレータ向けにMAXを最適化し、Qualcommと提携してモバイルおよびIoTデバイスでのエッジ展開を実現している。ランタイムにはPython APIとグラフコンパイラが含まれており、PyTorch、TensorFlow、ONNXからモデルを取り込むことができ、既存のAIパイプラインのシームレスな移行パスを提供する。
パフォーマンスとベンチマーク
Modularは独立したベンチマークを公開しており、標準的な生成AIモデル(GPT-2やBERTなど)において、Nvidia A100 GPU上のPyTorchのネイティブ推論と比較して、MAXが最大3倍のレイテンシ削減を達成することを示している。CPUのみの環境では、MAXはIntel Xeonプロセッサ上のTensorFlowと比較して2.5倍のスループット向上を示した。これらの結果は、コンパイラが演算を融合し、冗長なメモリコピーを排除し、ベクトル化命令を活用する能力に起因している。
2024年、Modularは標準化された業界評価であるMLPerf Inferenceベンチマークスイートに参加し、データセンターおよびエッジの両カテゴリで競争力のある結果を報告した。ただし、これらの主張の独立した検証は進行中であり、同社は最適化技術の完全な技術文書をまだ公開していない。
エコシステムとパートナーシップ
Modularは、Amazon Web Services、Microsoft Azure、Google Cloudなどの主要クラウドプロバイダーと協力し、MAXをマネージドサービスとして提供している。これらのパートナーシップにより、顧客は事前設定されたMAX環境を持つクラウドインスタンスにモデルを展開でき、セットアップ時間を短縮できる。同社はまた、CoreWeaveやOracle Cloudと連携し、高性能AIワークロードを対象とした専用GPUクラスタを提供している。
ハードウェア面では、ModularはAIアクセラレータのオープンスタンダードを推進する業界団体であるOpen Panelコンソーシアムに参加し、共通ランタイムインターフェースの開発に貢献している。この関与は、TSMCやBroadcomなどの企業による特殊シリコンの普及によって浮き彫りにされた課題である、新チップの既存AIスタックへの統合を簡素化することを目的としている。
今後の方向性
Modularは、動的実行が特に困難な分野である強化学習およびコンピュータビジョンモデルへのMAXのサポートを拡大する計画である。同社はまた、リソース制約のあるデバイスに大規模モデルを展開するために重要である、推論中のメモリフットプリント削減の技術を研究している。2024年後半時点で、Modularは収益数値を開示していないが、エンタープライズ採用とパートナーシップへの焦点は、AIインフラストラクチャの標準レイヤーになることを目指す戦略を示唆している。
その有望性にもかかわらず、ModularはNvidiaのTensorRTやOpenAIのTritonなどの既存プレイヤー、およびONNX Runtimeなどのオープンソースの代替案からの競争に直面している。同社の成功は、パフォーマンス上の優位性を維持しつつ、広範なハードウェア互換性と開発者採用を確保できるかどうかにかかっている。