英語からの翻訳

サポートベクターマシン(SVM)は、分類と回帰に用いられる教師あり最大マージンモデルであり、AT&Tベル研究所で開発され、統計的学習理論に基づいている。カーネルトリックを用いて入力を高次元空間に写像することで、非線形データを扱う。

サポートベクターマシン(SVM)は、分類、回帰、および外れ値検出に使用される教師あり学習モデルである。高次元空間において、異なるクラスのデータ点を可能な限り大きなマージンで分離する超平面または超平面の集合を構築する。AT&Tベル研究所で開発されたSVMは、1970年代から1980年代にかけてウラジミール・ヴァプニクとアレクセイ・チェルボネンキスによって提案されたVC理論などの統計的学習フレームワークに基づいている。それらは、理論的な扱いやすさとタスク間での柔軟性から、機械学習において最も研究されているモデルの一つである。

SVMは、クラスを最もよく分離する最大マージン超平面を見つけることにより線形分類を実行する。非線形問題に対しては、カーネルトリックを採用し、入力を暗黙的に高次元の特徴空間に写像して、そこで線形分離が可能になるようにする。このアプローチは、カーネル関数を用いたペアワイズ類似度比較を通じてのみデータを表現し、計算の複雑さを軽減する。最大マージンモデルとして、SVMは誤分類された例などのノイズの多いデータに対して頑健であり、イプシロン感応目的関数を用いて回帰タスクにも適応できる。

動機と中核的概念

データの分類は機械学習における一般的なタスクである。二値分類問題では、2つのクラスのいずれかに属するデータ点が与えられたとき、新しいデータ点がどのクラスに属するかを決定することが目標である。SVMでは、各データ点はp次元ベクトルとして扱われ、クラスを分離する(p-1)次元超平面を見つけることを目的とする。これは線形分類器として知られている。多くの超平面がデータを分類できるが、最適な選択はマージン、すなわち各側の最近傍データ点までの距離を最大化するものである。この最大マージン超平面は、最大マージン分類器、別名最適安定性のパーセプトロンを定義する。

形式的には、SVMは高次元または無限次元空間において超平面または超平面の集合を構築する。良好な分離は、任意のクラスの最近傍トレーニングデータ点までの距離が最大となる超平面によって達成される。なぜなら、より大きなマージンは一般に汎化誤差の低下と過学習の軽減につながるからである。

カーネルトリック

元のデータが有限次元空間で線形分離可能でない場合、SVMはデータをはるかに高次元の空間に写像し、そこで分離を容易にする。計算を管理可能に保つため、写像は、カーネル関数k(x, y)を介して元の空間で入力ベクトルのペアのドット積を簡単に計算できるように設計される。高次元空間の超平面は、ベクトルとのドット積が定数である点の集合によって定義される。これらのベクトルは、データからの特徴ベクトルの線形結合であり、パラメータalpha_iを持つ。決定関数はカーネル項の和、すなわちsum_i alpha_i k(x_i, x) = 定数となる。カーネルがyがxから離れるにつれて小さくなる場合、各項はテスト点とデータ点との近さを測定する。これにより、元の空間で凸でない集合間の複雑な判別が可能になる。

一般的なカーネル関数には、線形、多項式、動径基底関数(RBF)、シグモイドカーネルがある。カーネルとそのパラメータの選択は性能に大きく影響する。

最大マージン原理と正則化

最大マージン原理は、クラス間のマージンを最大化する超平面を見つけることを目的とする。実際には、データが完全に分離可能でない場合があるため、SVMはいくつかの誤分類を許容するソフトマージンを導入する。これは、マージン最大化と分類誤差のバランスをとる正則化パラメータ(しばしばCと表記)によって制御される。Cが大きいほど誤分類へのペナルティが重くなり、過学習につながる可能性がある一方、Cが小さいほどマージンは広くなるがトレーニング誤差が増える。このトレードオフは汎化にとって重要である。

サポートベクターと双対定式化

サポートベクターは、決定境界に最も近く、超平面を決定するトレーニングデータ点である。これらの点のみがモデルに影響を与え、他の点は解に影響を与えずに削除できる。最適化問題はしばしば双対形式で解かれ、そこでは目的関数がデータ点のドット積に依存するため、カーネルトリックが適用可能になる。双対定式化はまた、高次元特徴空間の効率的な処理を可能にする。

応用

SVMは、テキスト分類、画像認識、バイオインフォマティクス(例:タンパク質分類)、手書き数字認識など、幅広いタスクに適用されてきた。また、構造化予測問題にも使用される。その人気は理論的基盤と柔軟性に由来する。しかし、SVMがロジスティック回帰や線形回帰などの他の線形モデルよりも優れた予測性能を持つかどうかは明確ではなく、その利点は多くの場合、カーネルを用いた非線形境界の処理にある。

拡張と変種

サポートベクター回帰(SVR)など、回帰タスク用の拡張がいくつか存在し、そこでは目的関数がイプシロン感応的である。ハバ・シーゲルマンとウラジミール・ヴァプニクによって作成されたサポートベクタークラスタリングは、サポートベクター統計を教師なし学習に適用し、ラベルなしデータを自然なクラスタに分類する。SVMはまた、ニューラルネットワークアンサンブルなどの他の技術と組み合わせて、性能を向上させることもある。

他のモデルとの関係

SVMは、ロジスティック回帰やニューラルネットワークモデルなど、他の教師あり学習方法と関連している。ロジスティック回帰が確率を直接モデル化するのに対し、SVMはマージン最大化に焦点を当てる。高次元空間では、特徴数がサンプル数を超える場合にSVMがより効果的であることがある。しかし、深層学習の台頭により、SVMは画像認識や音声認識などのタスクではやや影が薄くなっており、そこではニューラルネットワークが優れている。それでも、SVMは機械学習ツールボックスにおいて基本的なツールであり続けており、特に小規模から中規模のデータセットや、解釈可能性と理論的保証が重視される問題で重要である。

理論的基盤

SVMは統計的学習理論、特にVC理論に基づいており、これは汎化誤差の限界を提供する。VC次元はモデルの容量を測定し、SVMは過学習を避けるためにこの容量を制御することを目指す。1990年代におけるSVMの開発、特にヴァプニクとAT&Tベル研究所の同僚による開発は、機械学習における重要な進歩を示した。1960年代に最初に提案されたカーネルトリックは、SVMに統合され、強力な非線形分類器を作り出した。

実践的考慮事項

SVMを使用する際、実践者は適切なカーネルを選択し、Cやカーネル固有のパラメータ(例:RBFのガンマ)などのハイパーパラメータを調整する必要がある。マージンが意味を持つように、特徴のスケーリングがしばしば必要である。SVMは大規模データセットに対して計算集約的であるが、逐次最小最適化(SMO)などの技術によりトレーニングが実行可能になっている。LIBSVMやscikit-learnなどのライブラリが効率的な実装を提供している。

限界と現在の状況

SVMには、カーネル選択とパラメータ調整への感度、非常に大規模なデータセットへのスケーリングの難しさなどの限界がある。深層学習の時代において、SVMはコンピュータビジョンや自然言語処理などの分野では支配的ではなくなり、そこではニューラルネットワークモデルが最先端の結果を達成している。しかし、SVMは多くの応用、特にデータが限られている場合や理論的保証が望まれる場合に依然として関連性がある。また、深い特徴抽出を備えたSVMなど、ハイブリッドモデルの構成要素としても使用される。

結論

サポートベクターマシンは古典的な機械学習の基礎であり、最大マージン最適化とカーネルトリックを通じて頑健な分類と回帰を提供する。その理論的基盤と柔軟性により、深層学習のような新しいモデルが登場しても永続的なツールとなっている。SVMを理解することは、機械学習とその応用を研究するすべての人にとって不可欠である。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·supervised-learning·classification·statistical-learning
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴