ツール拡張生成(TAG)は、生成プロセス中に大規模言語モデル(LLM)が外部ソフトウェアツール、データベース、APIと対話できるようにすることで、その能力を拡張する人工知能におけるアプローチである。事前学習済みパラメータのみに依存する従来のLLMとは異なり、TAGシステムは、ウェブ検索エンジン、コードインタープリタ、計算機、または専門分野のツールなどの関数を呼び出して、最新情報の取得、計算の実行、またはアクションの実行を行うことができ、それにより、より正確で、文脈に関連し、実行可能な応答を生成する。この技術は、静的モデルの主要な限界、すなわち古い知識、幻覚、および現実世界のタスクを実行できないことに対処し、現代のAIアプリケーションでますます採用されている。
この概念は、2020年に初めて提案され、LLMの出力を裏付けるために外部ソースから関連ドキュメントを取得することに焦点を当てた検索拡張生成(RAG)における初期の研究に基づいている。TAGは、モデルがドキュメント取得器だけでなく、より広範なツールを呼び出すことを可能にすることで、このアイデアを一般化する。例えば、TAG対応チャットボットは、ライブの天気APIにクエリを実行したり、Pythonスクリプトを実行してデータを分析したり、企業の内部データベースにアクセスしてユーザーの質問に回答したりできる。この統合は通常、ユーザーのリクエストを解析し、適切なツールを選択し、それらを実行し、結果をモデルの最終応答に組み込むフレームワークを通じて管理される。
RAGからTAGへの進化
検索拡張生成(RAG)は、生成プロセスとドキュメント検索メカニズムを融合させることでLLMのパフォーマンスを向上させる方法として2020年に登場した。Ars Technicaによると、RAGは「LLMのプロセスをウェブ検索や他のドキュメント検索プロセスとブレンドして、LLMが事実に固執するのを助けることで、LLMのパフォーマンスを向上させる方法」である。この技術は幻覚を減らし、再トレーニングなしでモデルがドメイン固有または更新された情報にアクセスできるようにする。しかし、RAGはテキストの取得に限定されており、モデルが世界と対話したり、アクションを実行したりすることはできない。ツール拡張生成は、実行可能なツールを組み込むことでこのパラダイムを拡張し、モデルが取得だけでなく、計算、変換、アクションも実行できるようにする。この進化は、タスクを自律的に完了できるエージェント型システムへのAIにおけるより広範なトレンドを反映している。
アーキテクチャとワークフロー
典型的なTAGシステムは、いくつかのコンポーネントで構成される。すなわち、中核となる推論エンジンとしてのLLM、利用可能な関数を定義するツールレジストリ、および対話を管理するオーケストレーション層である。ワークフローはユーザーのクエリから始まり、LLMがそれを解析してツール使用が必要かどうかを判断する。必要であれば、モデルは構造化呼び出し(例えば、ツールとその引数を指定するJSONオブジェクト)を生成し、オーケストレーション層がツールを実行し、結果がモデルのコンテキストにフィードバックされる。LLMはその後、ツールの出力を組み込んだ最終応答を合成する。このプロセスは反復的であり、モデルが必要な情報をすべて収集するために複数のツール呼び出しを行うことがある。例えば、旅行アシスタントは、完全な旅程を作成する前に、フライトAPI、ホテル予約サービス、天気サービスを呼び出すかもしれない。
ツールは、単純な計算機やデータベースクエリから、画像生成、コード実行、またはウェブブラウジング用の複雑なAPIまで多岐にわたる。ツールの選択は、いつどのツールを使用するかの例を含むモデルのトレーニングによって導かれることが多い。一部のシステムは、どのツールを呼び出すかを決定するために別のルーターモデルを採用し、他のシステムは、指示に従うLLMの固有の能力に依存している。
アプリケーションと使用例
ツール拡張生成は、さまざまなドメインで応用されている。カスタマーサポートでは、TAGによりチャットボットが注文管理システムにアクセスし、アカウント詳細を取得し、リアルタイムで返金を処理できる。ソフトウェア開発では、AIコーディングアシスタントがTAGを使用して、テストの実行、コードスニペットの実行、ウェブからのドキュメント取得を行う。データ分析では、TAGシステムがデータベースにクエリを実行し、統計計算を実行し、視覚化を生成できる。ヘルスケアでは、電子健康記録と医学知識ベースにLLMの出力を裏付けるためにTAGが調査されているが、評価、倫理、臨床的信頼性に関する課題が残っている。さらに、TAGは、スマートホームデバイスの制御、予定のスケジュール設定、メッセージの送信ができるパーソナルアシスタントを強化し、会話型AIと実行可能な自動化の間のギャップを埋めている。
課題と限界
その可能性にもかかわらず、TAGはいくつかの課題に直面している。1つの主要な問題は信頼性である。ツールが誤ったデータや悪意のあるデータを返した場合、LLMはそれを応答に組み込む可能性があり、誤情報につながる。例えば、MIT Technology Reviewが指摘したように、モデルが「バラク・フセイン・オバマ:アメリカ初のイスラム教徒大統領?」のような修辞的な質問を本のタイトルから取得した場合、誤った記述を生成する可能性がある。もう1つの課題はレイテンシーであり、各ツール呼び出しがネットワークまたは計算時間を追加する。セキュリティも懸念事項であり、TAGシステムは意図しないアクションを実行したり、機密データにアクセスしたりするために悪用される可能性がある。さらに、複数のツールをオーケストレーションする複雑さは、エラーのリスクを増大させ、堅牢なエラーハンドリングを必要とする。最後に、TAGシステムの実行コストは、追加のAPI呼び出しと計算リソースのために高くなる可能性がある。
今後の方向性
TAGシステムを改善するための研究が進行中である。モデルが以前のツール対話から学習する自己改善や、過去の検索を保存するメモリモジュールなどの技術が、パフォーマンスを向上させるために開発されている。2023年現在、新しい実装では、クエリを複数のドメインに拡張し、メモリを使用して将来の検索を改善する能力などの拡張モジュールが組み込まれている。TAGとマルチエージェントシステムや強化学習などの他のAIパラダイムとの統合も探究されている。ツールがより標準化され、APIがよりアクセスしやすくなるにつれて、TAGは次世代のAIアシスタントの基本コンポーネントとなり、現実世界の環境でより自律的かつ効果的に動作できるようになる可能性が高い。