会話型AIとは、機械が人間の言語を理解・処理・生成し、テキストまたは音声によって自然な多ターン対話を人間と行えるようにする技術を指す。これは、チャットボット、音声アシスタント、対話型音声応答システム、汎用大規模言語モデルの対話能力を含む広範な分野である。会話型AIは、自然言語処理、音声認識、そして音声システムでは音声合成の交点に位置する。
構成要素
会話型AIシステムは、通常、いくつかのサブシステムを組み合わせる。入力理解は、音声をテキストに変換するか、入力されたテキストを解析する。対話管理は、ターン間の会話状態、意図、文脈を追跡する。応答生成は、返答を生成し、歴史的にはテンプレートや検索によるものが主流だったが、近年は生成型言語モデルによるものが増えている。さらに、音声インターフェースでは、返答を音声に戻すための音声合成が必要となる。多ターン交換で文脈を維持するシステムは、モデルのコンテキストウィンドウに依存して以前のターンを記憶し、多くの本番システムではシステムプロンプトを使用して、人格、口調、行動上の制約を固定する。
進化
初期の会話システムは狭くルールベースであり、ユーザーの意図を限られたスクリプト応答のメニューに一致させるもので、対話型電話ツリーやELIZAのような初期のチャットボットがその典型例である。2010年代には、意図分類ベースの仮想アシスタント(SiriやAlexaなど)が台頭し、タイマー設定や天気確認などの固定タスクを処理したが、通常は真のオープンドメイン理解はなかった。深層学習、そして後のトランスフォーマーベースの言語モデルへの移行により、オープンドメインの会話能力が可能になった。モデルは、明示的にプログラムされなくても、ほぼあらゆるトピックで首尾一貫した対話を保持できるようになり、この変化はChatGPTによって最も顕著に示され、人間のフィードバックからの強化学習によって洗練され、ユーザーが実際に望むものに応答を合わせるようになった。後のシステムでは、検索拡張生成を追加して、回答を最新または独自の情報に基づかせ、ツール使用を追加して、会話の途中でウェブ検索やデータベース照会などのアクションをシステムが実行できるようにした。
応用と批判
会話型AIは、カスタマーサポート、医療トリアージ、教育、アクセシビリティツール、パーソナルアシスタントで広く展開されており、対話を自律的なタスク完了に拡張するAIエージェントの基盤でもある。批判は、一般的なチャットボットへの批判と同様である。自信に満ちた会話調で誤った情報を幻覚すること、ユーザーがシステムを過信したり、感情的に過度に依存したりするリスク(システムはユーザーを理解していない)、そして音声インターフェースでは、常時待機するマイクに関するプライバシー懸念がある。研究者は、会話の流暢さが真の理解を反映しているのか、それとも流暢なパターン補完に過ぎないのかについて議論を続けており、この問題は確率的オウム論などの批判と密接に関連している。