敵対的例(adversarial examples)とは、AIモデルを欺くために設計された入力であり、通常は正当なデータに小さく、しばしば知覚不能な摂動を加えることで、機械学習モデルに誤分類や誤動作を引き起こす。これらの入力は、ほとんどの学習アルゴリズムが前提とする統計的仮定、すなわち訓練データとテストデータが同一の分布から抽出されるという仮定を悪用する。実際には、敵対者はこの仮定に違反する捏造データを意図的に供給でき、スパムフィルタリング、コンピュータセキュリティ、生体認証、自動運転などの高リスク用途で障害を引き起こす可能性がある。
敵対的例の研究は、敵対的機械学習というより広い分野に属し、機械学習アルゴリズムへの攻撃とその防御の両方を考察する。一般的な攻撃カテゴリには、推論時に入力を改変して検出を回避する回避攻撃、訓練データを汚染するデータポイズニング攻撃、分散学習システムを標的とするビザンチン攻撃、攻撃者がモデルの機能を盗んだり複製しようとするモデル抽出が含まれる。
歴史的発展
敵対的例への関心は、スパムフィルタリングに関する初期の研究から生まれた。2004年1月のMITスパム会議で、ジョン・グラハム=カミングは、機械学習スパムフィルタが別のフィルタを打ち負かすために使用できることを実証し、スパムメールに追加する単語を自動的に学習して非スパムとして分類させた。同年後半、ニレシュ・ダルビらは、スパムフィルタで使用される線形分類器が単純な回避攻撃で打ち負かされる可能性があると指摘し、スパマーがメールに「良い単語」を挿入した。2007年頃、一部のスパマーは画像スパム内の単語にランダムノイズを追加して、OCRベースのフィルタを無効化した。
2006年、マルコ・バレーノらは「Can Machine Learning Be Secure?」を発表し、攻撃の広範な分類法を概説した。2013年まで、多くの研究者はサポートベクターマシンやニューラルネットワークなどの非線形分類器が敵対者に対して頑健である可能性を期待していた。その期待は、バッティスタ・ビッジョらが2012年と2013年にこれらのモデルに対する最初の勾配ベース攻撃を実証したことで薄れた。2014年以降、クリスチャン・セゲディらは、深層ニューラルネットワークが敵対者によって欺かれる可能性を示し、再び勾配ベースの手法を用いて敵対的摂動を作り出した。
メカニズムと特性
敵対的例は通常、入力に小さく慎重に計算された摂動を追加することで生成される。画像分類器の場合、これは人間には知覚できないがモデルに異なるクラスを高い信頼度で出力させる方法でピクセル値を変更することを含むことが多い。高速勾配符号法などの勾配ベース手法は、モデルの損失関数を使用して分類誤差を最大化する摂動の方向を決定する。
さらなる研究により、敵対的例は制御されていない環境では生成が難しいことが明らかになった。これは、小さな回転やわずかな照明変化などの環境的制約がノイズの効果を打ち消す可能性があるためである。例えば、実験室条件下でモデルを欺く敵対的画像は、異なる角度や照明で見ると敵対性を失う可能性がある。この観察は、物理的条件が変動性をもたらす実世界の攻撃に影響を与える。
Google Brainの研究者であるニック・フロストらは、敵対的例を作成するよりも、物理的に標識自体を撤去することで自動運転車に一時停止標識を見逃させる方が簡単であることが多いと指摘した。フロストはまた、敵対的機械学習コミュニティが、特定のデータ分布で訓練されたモデルが完全に異なる分布で良好に機能するという誤った仮定をしていると主張した。彼は、人間の知覚に近い特性を取り入れた機械学習への新しいアプローチを探求することを提案した。
注目すべき実証
いくつかの注目すべき実証が敵対的例の力を示している。研究者らは、画像内の1ピクセルだけを変更することで深層学習アルゴリズムを欺けることを示した。別のケースでは、Googleの物体検出AIがライフルとして分類するように設計されたテクスチャを持つ3Dプリントの玩具のカメが、どの角度から見てもライフルとして分類された。このカメを作成するには、低コストで市販の3Dプリント技術のみが必要だった。
機械的に改変された犬の画像が、コンピュータと人間の両方にとって猫のように見えることが示され、2019年の研究では、人間が機械が敵対的画像をどのように分類するかを推測できると報告された。研究者らはまた、自動運転車が合流標識や速度制限標識として分類するように一時停止標識の外観を摂動させる方法を発見した。別の事件では、McAfeeがテスラの旧Mobileyeシステムを攻撃し、速度制限標識に2インチの黒いテープを追加することで時速50マイル超過で運転させた。
顔認識システムやナンバープレートリーダーを欺くために設計されたメガネや衣服の敵対的パターンは、「ステルスストリートウェア」というニッチな産業を生み出した。これらの物理的敵対的例は、この現象がデジタル入力に限定されないことを示している。
セキュリティとマルウェアへの応用
敵対的例はコンピュータセキュリティに重要な影響を与える。マルウェア検出では、研究者らが敵対的マルウェア生成の手法を提案し、悪意のある機能を維持しながら学習ベースの検出器を回避するバイナリを自動的に作成する。GAMMAなどの最適化ベース攻撃は、遺伝的アルゴリズムを使用して、パディングや新しいPEセクションなどの良性コンテンツをWindows実行ファイルに注入する。このアプローチは、回避を誤分類成功率と注入ペイロードのサイズのバランスを取る制約付き最適化問題として捉え、商用アンチウイルス製品への転移性を示している。
補完的な研究では、敵対的生成ネットワーク(GAN)を使用して、マルウェアが良性として分類される原因となる特徴空間の摂動を学習する。Mal-LSGANは、例えば、標準的なGAN損失を最小二乗目的と修正された活性化関数に置き換え、訓練の安定性を向上させる。この手法は、複数の検出器にわたって真陽性率を大幅に低下させる敵対的マルウェア例を生成する。
セキュリティ用途でマルウェアやコンピュータウイルス分析に使用されるクラスタリングアルゴリズムも脆弱である。これらのアルゴリズムはマルウェアファミリーを特定し、特定の検出シグネチャを生成することを目的とするが、敵対者は入力を操作してクラスタリングを回避したり、結果として得られるシグネチャを誤解させたりできる。
音声および物理的攻撃
敵対的攻撃は画像に限定されない。研究者らは、インテリジェントアシスタントへのコマンドを良性に見える音声に偽装する敵対的音声入力を作成した。これらの攻撃は、ターゲットシステムにアルゴリズムを注入したり、意図しないアクションを引き起こしたりするために使用できる。並行する文献では、人間がそのような刺激を知覚し、隠されたコマンドを検出または理解できるかどうかを検討している。
人間の行動認識の領域では、新興の敵対的攻撃が非常に効果的である。これらのシステムは、監視、自動運転車、屋内監視に使用される。攻撃者は、人間の特徴の表現にノイズを導入して認識システムを欺く。特に、これらの攻撃は認識システム自体へのアクセスを必ずしも必要とせず、人間のユーザーには知覚できない可能性がある。
防御と緩和策
敵対的例に対する防御は依然として未解決の課題である。敵対的訓練(モデルを敵対的例で訓練して頑健性を向上させる手法)などの技術はある程度の有望性を示しているが、クリーンな入力での精度を低下させることが多い。他のアプローチには、入力前処理、敵対的入力の検出、形式的保証を提供する認証済み防御が含まれる。
敵対的機械学習は依然として学界に深く根ざしているが、Google、Microsoft、IBMなどの大規模テック企業は、機械学習モデルの頑健性を具体的に評価し、敵対的攻撃のリスクを最小化できるように、ドキュメントとオープンソースコードベースのキュレーションを開始している。これらのリソースは、評価方法を標準化し、より回復力のあるシステムの開発を促進することを目的とする。
データポイズニングと創造的保護
関連する脅威はデータポイズニングであり、攻撃者が訓練データを汚染してモデルの動作に影響を与える。2023年、シカゴ大学の研究者らは、ナイトシェードと呼ばれるデータポイズニングフィルタをリリースした。これは、視覚芸術家が自分の作品に適用して、通常は画像作成者の同意なしにインターネットからデータをスクレイピングするテキストから画像へのモデルのデータセットを汚染するために作成された。このツールは、敵対的技術の防御的使用を表し、個人が生成AIモデルでの無許可使用から知的財産を保護できるようにする。
進行中の研究と将来の方向性
敵対的例の分野は進化を続けており、研究者らは新しい攻撃ベクトルとより頑健な防御メカニズムの両方を探求している。特定のデータ分布で訓練されたモデルが完全に異なる分布で良好に機能するという仮定は、ますます疑問視されている。一部の研究者は、小さな摂動に対して一般的により頑健な人間の知覚をよりよく模倣する機械学習への新しいアプローチを提唱している。
深層学習モデルがより重要なアプリケーションに展開されるにつれて、敵対的例の理解と緩和はますます重要になる。攻撃と防御の相互作用は進行中の研究を推進し、各新しい防御はしばしばより洗練された攻撃を生み出す。最終的な目標は、クリーンなデータで正確であるだけでなく、敵対者の存在下でも信頼性のある機械学習システムを作成することである。