英語からの翻訳

MobileNetは、モバイルおよび組み込みシステムにおける効率的なオンデバイス推論のために設計された畳み込みニューラルネットワークアーキテクチャのファミリーであり、精度と低い計算コストのバランスを取っています。

MobileNetは、画像分類、物体検出、その他のコンピュータビジョンタスクのために開発された畳み込みニューラルネットワーク(CNN)アーキテクチャのファミリーである。これらのモデルは、小型サイズ、低レイテンシ、低消費電力に重点を置いて設計されており、スマートフォンや組み込みシステムなどのリソース制約のあるデバイス上でのオンデバイス推論やエッジコンピューティングに適している。当初は、機械学習モデル用の軽量ランタイムであるTensorFlow Liteを使用して、モバイルデバイス上で効率的に動作するように設計された。

モバイルデバイス上での効率的なディープラーニングモデルの必要性から、Googleの研究者たちはMobileNetを開発した。2025年6月の時点で、このファミリーには5つの主要バージョンが含まれており、それぞれが前身を基に性能と効率を向上させつつ、制約のある環境への適合性を維持している。

アーキテクチャの原則

MobileNetアーキテクチャは、いくつかの主要な技術を通じて計算コストを削減することに焦点を当てている。中核となる革新は、深さ方向分離畳み込みの使用であり、これは標準的な畳み込みを2つの別々の操作に分解する。すなわち、各入力チャネルを独立してフィルタリングする深さ方向畳み込みと、出力を結合するポイントワイズ畳み込み(1×1畳み込み)である。この因数分解により、標準的な畳み込みと比較してパラメータ数と浮動小数点演算数が大幅に削減され、処理能力が限られたデバイス上での効率的な推論が可能になる。

もう1つの重要な戦略は、モデルサイズと計算負荷を制御するハイパーパラメータの導入である。幅乗数(αと表記)は各層のチャネル数を調整し、αの値が小さいほど、精度を犠牲にしてより小さく高速なモデルが生成される。解像度乗数(ρ)は入力画像の解像度を調整し、解像度が低いと処理が高速化されるが、精度が低下する可能性がある。

アーキテクチャには、バッチ正規化やデータ拡張などの技術も組み込まれており、トレーニングの安定性と一般化を向上させている。これらの設計上の選択により、MobileNetはモバイルおよび組み込みコンテキストでのリアルタイムアプリケーションに人気のある選択肢となっている。

MobileNetV1

MobileNetV1は2017年4月に発表された。その主なアーキテクチャ上の革新は、深さ方向分離畳み込みの組み込みであり、この概念は2013年にGoogle Brainでのインターンシップ中にLaurent Sifreによって、収束速度の向上とモデルサイズの削減を目的としたAlexNetの変種として初めて導入された。深さ方向分離畳み込みは、各標準畳み込みを、深さ方向フィルタ(チャネルごとに動作)と、深さ方向層からの出力をマージするポイントワイズ結合(1×1畳み込み)に分解する。

MobileNetV1のデフォルトには、幅乗数1.0と解像度乗数224x224が含まれていた。しかし、これらの乗数を調整することで、開発者はフォームファクタと精度のバランスを取ることができた。アーキテクチャはまた、各畳み込み後にReLU活性化関数を使用し、トレーニングを加速するためにBatch Normalizationを適用した。

MobileNetV2

2019年3月に発表されたMobileNetV2は、2つの重要な改良、すなわち逆残差層と線形ボトルネックを導入した。逆残差は、従来の残差ブロックの構造を反転させ、最初に入力チャネルを拡張し、次に深さ方向畳み込みを実行し、最後により少ないチャネル数に射影し戻す。この拡張により、深さ方向畳み込みはより高次元の空間で動作でき、情報の流れをより多く保持できる。

線形ボトルネックは、低次元空間での非線形性が情報損失を引き起こすという直感に基づいて、射影層からReLU活性化関数を除去する。これらの層を線形に保つことで、チャネル数が少ない場合でもモデルはより多くの表現力を保持する。これらの改良により、V1よりも高い精度と低いレイテンシが実現され、V2はモバイルビジョンタスクの一般的な選択肢となった。

MobileNetV3とV4

2019年にリリースされたMobileNetV3は、3つのバリアント、すなわちMobileNetV3-Large、MobileNetV3-Small、およびPixel 4スマートフォン用に最適化されたMobileNetEdgeTPUを導入した。これらのモデルは、モバイルレイテンシを直接測定するニューラルアーキテクチャ検索(NAS)を通じて発見され、精度と推論速度の間の望ましいトレードオフを達成した。V3にはまた、swishおよびシグモイド活性化関数の区分的線形近似(h-swishおよびh-sigmoid)、スクイーズアンドエキサイテーションモジュールが含まれ、V2の逆ボトルネック構造を継承した。

2024年9月に発表されたMobileNetV4は、NASによっても発見された多数のアーキテクチャでファミリーを拡張した。V4は、ビジョントランスフォーマーに触発されたマルチクエリ注意機構を導入し、以前のバージョンの逆残差と逆ボトルネックの概念を統合する、ユニバーサル逆ボトルネックと呼ばれる新しいポストミックスブロックを提案した。

MobileNetV5と将来の方向性

MobileNetV5のアーキテクチャは、2025年6月にGemma 3n(言語モデル)のリリース直後に発表された。発表では技術レポートが間もなく公開されると言及されたが、2025年10月の時点で、そのようなレポートは公開されていない。V5ネットワークは、最大のV4バリアントの約10倍のサイズであると報告されており、モバイル展開のための達成可能な効率を維持しながら、より高容量のモデルへのシフトを示唆している。

開発を通じて、MobileNetは多くのアーキテクチャに影響を与え、組み込みビジョンシステムの基盤であり続けており、自動運転、ロボティクス、モバイル写真などの分野での実用的なアプリケーションを可能にしている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:convolutional-neural-networks·computer-vision·deep-learning·google
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴