Sentence-BERTは、事前学習済みのBERTネットワークを改良し、シームレスネットワークとトリプレットネットワーク構造を用いて、意味的に意味のある文の埋め込みを導出するものである。2019年にダルムシュタット工科大学のユビキタス知識処理研究室のNils ReimersとIryna Gurevychによって発表され、意味的類似性タスクにおけるBERTの計算的非効率性に対処する。標準的なBERTでは、両方の文をネットワークに供給し、コスト高なクロスエンコーダー処理を実行する必要があり、大規模な類似性検索には実用的ではない。 Sentence-BERTは、代わりに個々の文に対して固定サイズの埋め込みを生成し、コサイン類似度や他の距離メトリクスを用いて類似性を計算できるようにすることで、クラスタリングや情報検索などのタスクに適している。
このアーキテクチャは、シームネスネットワークを採用しており、同じBERTモデルが2つの入力文に独立して適用され、2つの埋め込みを生成します。これらの埋め込みは、プーリング層(通常は平均プーリング)を使用して比較され、固定長のベクトルが得られる。同ネットワークは、ラベル付きデータセット上で、ソフトマックス損失やトリプレット損失などの対比的客観的関数を用いて微調整され、意味的に類似した文が埋め込み空間内の近くの点に対応付けられることを保証する。この設計により、コーパスの埋め込みを事前計算して保存できるため、クロスエンコーダーと比較して類似性比較の時間が数桁削減され、効率的な推論が可能となる。
学習と目的
Sentence-BERTは、スタンフォード自然言語推論(SNLI)コーパスやマルチジャンル自然言語推論(MultiNLI)データセットなどのデータセットでトレーニングされる。これらのデータセットには、含意、矛盾、または中立の関係でラベル付けされた文のペアが含まれる。モデルは、シームネス構造と、2つの文間の関係を予測するソフマックス分類器を使用して微調整される。最終的な埋め込みは、BERTモデルのプールされた出力から取得される。あるいは、トリプレット損失を使用することもでき、その場合、モデルは、ネガティブな例からの距離を最大化しながら、アンカーとポジティブな例間の距離を最小化するようにトレーニングされる。このアプローチは、埋め込み空間を類似性タスク用に直接最適化する。
性能と効率性
SentenceTransformerは、意味的類似性計算の速度を大幅に改善します。標準的なBERTクロスエンコーダーが、最新のGPU上で10,000組の文を処理するのに約65時間かかる場合、SentenceTransformerは同じ類似性を約5秒で計算でき、約9,000倍の高速化を実現する。この効率性により、セマンティック検索、重複検出、大規模テキストコレクションのクラスタリングなどのリアルタイムアプリケーションに実用的である。埋め込みの品質は、より複雑なクロスエンコーダーに匹敵し、一部のベンチマークではわずかに低くなるかもしれないが、そのトレードオフは大規模な使用には多くの場合許容される。
アプリケーションとバリアント
文BERTは、さまざまな自然言語処理アプリケーションで広く採用されている。意味論テキスト類似性、パラフレーズ検出、情報検索などに一般的に使用される。また、質問応答システムにおける「密なパッセージ検索」のベースやバックボーンとしても機能している。多言語対応、分野固有の微調整版など、いくつかの「バリアント」を含む「多言語モデル」が開発されている。このアプローチは、使いやすい実装と事前学習済みモデルを提供する「文トランスフォーマー」ライブラリなど、同様の埋め込みモデルをインスピレーションしてきた。
他のモデルとの関係
Sentence-BERTは、Transformer (architecture)アーキテクチャとLarge language modelパラダイムの上に構築されており、特に文レベルの効率的な表現を対象としている。テキストを生成するOpenAIのGPTのような生成モデルとは異なり、Sentence-BERTは「識別的な」タスクに焦点を合わせています。また、文ペアを共同で処理する元のBERTのようなクロスエンコーダーとは明確に区別されます。シームネスアーキテクチャは、Neural networkの一種であり、顔認識など他の分野で使用され、ここで言語用に適応されています。Sentence-BERTによって生成された埋め込みは、クラスタリングや次元削減などのMachine learning技術と組み合わせてよく使用されます。
制限と将来の方向性
その利点にもかかわらず、Sentence-BERTには制限がある。埋め込みの品質はトレーニングデータの質とプーリング戦略に大きく依存する。より深い文脈理解を必要とする複雑な意味関係を捉えきれない場合がある一方で、ドメインシフトに敏感である可能性がある。研究者たちは、大規模なラベルなしコーパスでの対比学習の導入や、より高度なプリング方法の使用など、改善点を探求している。2025年時点では、Generative AIとLarge language modelに基づく新しい埋め込みモデルが登場しているが、Sentence-BERTは依然として文章埋め込みの基盤であり、広く使用されるアプローチである。