マルチタスク学習(MTL)は、Machine learningの一分野であり、複数の学習タスクを同時に解決しながら、タスク間の共通点と相違点を活用する。このアプローチにより、タスク固有のモデルを個別に訓練する場合と比較して、学習効率と予測精度が向上する可能性がある。本質的に、マルチタスク学習は、異なるタスク間のトレードオフを伴う多目的最適化問題である。MTLの初期バージョンは「ヒント」と呼ばれていた。
広く引用される1997年の論文で、リッチ・カルアナはMTLを、関連タスクの訓練信号に含まれるドメイン情報を帰納的バイアスとして使用することで汎化を改善する帰納的転移のアプローチとして特徴付けた。これは、共有表現を使用しながらタスクを並行して学習することで実現され、各タスクで学習された内容が他のタスクの学習をより良く助けることができる。分類の文脈では、MTLは複数の分類タスクを共同で学習することで、その性能を向上させることを目的とする。一例としてスパムフィルタがあり、これは異なるユーザー間で異なるが関連する分類タスクとして扱える。異なる人々はスパムと正当なメールを区別する特徴の分布が異なる(例えば、英語話者はすべてのロシア語メールをスパムと見なすかもしれないが、ロシア語話者はそうではない)が、送金関連のテキストなどの共通点も存在する。各ユーザーのスパム分類問題をMTLで共同で解決することで、解が互いに情報を与え合い、性能を向上させることができる。他の設定には、多クラス分類やマルチラベル分類が含まれる。
マルチタスク学習が機能する理由は、関連タスクでうまく機能することをアルゴリズムに要求することで誘発される正則化が、すべての複雑さを均一に罰することで過適合を防ぐ正則化よりも優れているためである。MTLは、タスクが重要な共通点を共有し、一般的にわずかにサンプル不足である場合に特に有用であり、無関係なタスクの学習にも有益であることが示されている。
タスクのグループ化と重複
MTLパラダイム内では、情報は一部またはすべてのタスク間で共有できる。タスクの関連性の構造に応じて、情報を選択的に共有することができる。タスクはグループ化され、階層内に存在し、または一般的なメトリックに従って関連付けられる可能性がある。形式的には、各タスクをモデル化するパラメータベクトルは、基礎となる基底ベクトルの線形結合であり得る。この基底での類似性はタスクの関連性を示し、例えば、スパース性では、タスク間の非ゼロ係数の重複が共通性を示す。タスクのグループ化は、基底要素のサブセットによって生成される部分空間にあるタスクに対応し、グループは互いに素または重複する可能性がある。タスクの関連性は事前に課すことも、データから学習することもできる。階層的な関連性は、明示的な学習なしに暗黙的に活用することもでき、例えば、ドメイン間で効果的な共同学習を確実にするためにタスク間のサンプルの関連性を学習することがある。
無関係なタスクの活用:補助学習
補助学習では、主要タスクのグループを、主要タスクと無関係な補助タスクのグループを使用して学習する。適切な無関係タスクを使用すると、同じ入力データを使用した共同学習が有益であることが示されており、標準的なMTLよりも大幅な改善を提供する。タスクの関連性に関する事前知識は、データ分布の特異性をスクリーニングすることで、各タスクグループのよりスパースで情報量の多い表現につながる可能性がある。メソッドは、各グループ内の共有された低次元表現を好み、異なるグループのタスクにペナルティを課して直交表現を促進することがある。無関係な補助タスクを使用した学習には、有用な補助タスクを見つけることと、すべてのタスクの損失を有用に組み合わせることの2つの課題がある。一部のメソッドは、訓練中にこれらをデータから学習する。
知識の転移
MTLに関連するのは知識転移である。従来のMTLはタスク間で共有表現を同時に開発するのに対し、知識転移は逐次的な共有表現を意味する。大規模な機械学習プロジェクト、例えば深層畳み込みニューラルネットワークのGoogLeNet(画像ベースのオブジェクト分類器)は、関連タスクを学習するさらなるアルゴリズムに有用な堅牢な表現を開発できる。事前訓練されたモデルは、別の学習アルゴリズムでの前処理のための特徴抽出器として使用したり、類似アーキテクチャのモデルを初期化して、異なる分類タスクのために微調整したりできる。このアプローチは、Deep learningやNeural networkの実践で一般的であり、Large language modelの開発も含まれる。
複数の非定常タスク
伝統的に、MTLと知識転移は定常的な学習設定に適用される。非定常環境への拡張は、グループオンライン適応学習(GOAL)と呼ばれる。情報共有は、学習者が継続的に変化する環境で動作する場合に特に有用であり、学習者は別の学習者の以前の経験から迅速に適応する恩恵を受けることができる。このようなグループ適応学習は、金融時系列の予測、コンテンツレコメンデーションシステム、適応型自律エージェントの視覚理解に応用されている。
マルチタスク最適化
マルチタスク最適化は、予測分析における転移学習とMTLに触発され、最適化プロセス全体の解決に焦点を当てる。主な動機は、最適解や関数ランドスケープ特性の点で最適化タスクが関連している場合、検索の進行を転移して他のタスクの検索を加速できることである。成功は単純なタスクから複雑なタスクへの一方向の知識転移に限定されず、実際には関連性を双方向に活用する試みが行われる。
メソッドとアーキテクチャ
MTLの主要な課題は、複数のタスクからの学習信号を単一のモデルに組み合わせることである。これは、タスクが互いにどの程度一致または矛盾するかに依存する。Deep learningでの一般的なアーキテクチャアプローチには、タスク間で共有される隠れ層とタスク固有の出力層を使用するハードパラメータ共有と、各タスクが独自のモデルを持ち、パラメータを正則化して類似性を促進するソフトパラメータ共有が含まれる。Transformer (architecture)ベースのモデルでは、MTLはしばしばマルチタスク微調整を介して実装され、事前訓練されたモデルが複数の目的で同時に訓練され、タスク固有のヘッドを使用することがある。Data Augmentation、Dropout、Batch Normalizationなどの技術は、共有表現を正則化するのに役立つ。Adam (Optimizer)やStochastic Gradient Descent Variantsなどの最適化メソッドが一般的に使用され、Learning Rate Schedulingの調整でタスク損失のバランスを取ることがある。
応用と研究
MTLはさまざまなドメインに適用されている。Computer visionでは、GoogLeNetやResidual Network (ResNet)アーキテクチャなどのモデルが、オブジェクト検出やセグメンテーションなどの関連タスクの共同訓練から恩恵を受けている。自然言語処理では、OpenAI、Anthropic、Google DeepMindなどのTransformer (architecture)モデルが、多様な目的での事前訓練中にMTLを使用している。産業界では、Amazon Web Services、Microsoft Azure、Google Cloudなどの企業がAIプラットフォームでMTL機能を提供している。MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)、University of Torontoなどの研究機関が基礎的な研究に貢献している。著名な研究者には、Michael I. Jordan、Anima Anandkumar、およびリッチ・サットン(提供されたリストにはないが、この分野には多くの貢献者がいる)が含まれる。MTLはまた、タスクが難易度で順序付けられるCurriculum Learningや、複数の目的で人間のフィードバックを使用するReinforcement Learning from AI Feedback (RLAIF)とも交差する。
課題と将来の方向性
利点にもかかわらず、MTLは、無関係なタスクが性能を低下させる負の転移や、タスク損失のバランス調整などの課題に直面している。トレードオフを処理するための多目的最適化技術が開発されている。2020年代初頭の時点で、適応タスク重み付け、タスクグループ化メソッド、および非定常およびマルチエージェント設定へのMTLの拡張に関する研究が続けられている。このパラダイムは、汎化と効率を改善するためのArtificial intelligenceの中核ツールであり続けている。