転移学習とは、あるタスクで学習したモデルやその表現を、ランダムに初期化された重みから新しいモデルを訓練する代わりに、異なるが関連するタスクの出発点として再利用する実践である。これは、画像内のエッジや形状の認識、テキスト内の文法や単語の関係の理解など、ドメイン内の多くのタスクが共通の基盤構造を共有しており、その構造をすでに学習したモデルは、さらに特化するために比較的少ない追加データしか必要としないという観察に基づいている。
歴史と動機
転移学習は、認知科学と1990年代の「学習の学習」を探求する初期の機械学習研究にルーツを持つが、2012年のImageNetの瞬間に支配的な実践的パラダイムとなった。このときAlexNetは、100万枚のラベル付き画像で訓練されたConvolutional neural networkが、視覚的特徴、エッジ、テクスチャ、物体の部品を学習し、それがごく少量のタスク固有データと再訓練だけで、まったく異なる画像分類問題に驚くほどよく転移することを示した。これにより、転移学習はコンピュータビジョンにおいて長年にわたり標準的な戦略となった。実務者はゼロから訓練する代わりに、ImageNetで事前訓練されたネットワークを取得して適応させた。
自然言語処理では、類似した転換が後になって到来し、ジェレミー・ハワードとセバスチャン・ルーダーのULMFiTアプローチなどの研究によって触発され、決定的には2018年のBERTによってもたらされた。これは、汎用的な言語モデリング目的で事前訓練された単一のモデルが、広範なNLPタスクにわたって最先端の性能に微調整できることを示した。これにより、「事前訓練してから転移する」というレシピが標準となり、現代の大規模言語モデルの基盤として現在も続いている。
事前訓練と微調整との関係
転移学習は一般的な原理であり、事前訓練と微調整は、今日の深層学習で通常それを実行する具体的なメカニズムである。モデルは大規模で一般的なデータセットで事前訓練され、多くの場合自己教師あり学習を使用して手動ラベルを不要にし、その事前訓練済みモデルはターゲットタスク用の小さなラベル付きデータセットで微調整される。転移学習の成功は、ソースとターゲットのタスクまたはドメインがどれだけ関連しているかに依存する。自然画像から医療用X線への転移は、2つの自然画像タスク間の転移よりもうまく機能しない。なぜなら、データの低レベルの統計的構造がより異なるからである。
技術
事前訓練済みモデルのどの程度を適応させるかについて、いくつかの戦略が存在する。特徴抽出は、事前訓練済みネットワークを完全に凍結し、その出力の上に新しい最終層のみを訓練する。これは、ターゲットデータセットが非常に小さい場合に有用である。完全な微調整はすべてのパラメータを更新し、十分なターゲットドメインデータが利用可能な場合に通常最良の性能を達成する。LoRAなどのパラメータ効率的な方法は、これらの極端な中間に位置し、事前訓練済みの重みの大部分を変更せずに、少数の追加パラメータを適応させる。これは、ベースモデルが数千億パラメータに成長するにつれて特に重要になっている。
重要性
転移学習は、深層学習が少数の資金豊富な研究所の外で実用的になった主要な理由である。大規模なモデルをゼロから訓練する予算を持たない研究チームや企業でも、既存の事前訓練済みモデルを適応させることで、有能で専門化されたシステムを構築できる。また、これは基盤モデルへの広範なシフトの基盤でもあり、単一の大規模な事前訓練済みモデルが多くの下流アプリケーションの共有基盤として機能し、各アプリケーションが独自のモデルをゼロから訓練する必要がない。この技術の中心的な限界は、負の転移と呼ばれることもあり、事前訓練データとあまりにも異なるドメインにモデルを適応させると、ゼロから訓練するよりも性能が悪くなることがあり、よく一致したベースモデルの選択が重要な実践的決定となる。