エバル(Evals)は、評価(evaluations)の略であり、人工知能モデルまたはエージェントの挙動を体系的に評価するものである。大規模言語モデルや生成AIアプリケーションの文脈では、エバルは、さまざまなタスクやシナリオにわたって性能、安全性、信頼性を測定するために設計された構造化されたテストスイートとして機能する。これらは、AIシステムの開発、デバッグ、デプロイにおける中核的な実務者ツールであり、モデルバージョンの比較、回帰の検出、アプリケーションが意図した要件を満たしていることの検証のための定量的な基盤を提供する。
エバルの実践は、機械学習と深層学習の急速な進歩とともに成長してきた。初期のAI研究では、進捗を測るために、既知の回答を持つ固定されたタスクの集合であるベンチマークデータセットに依存することが多かった。モデルがより高性能になり、実世界の製品に統合されるにつれて、より微妙でアプリケーション固有の評価の必要性が高まった。現在のエバルは、標準的なベンチマークでの正確性だけでなく、推論、事実の一貫性、安全性、バイアス、指示追従、そしてAIシステムが環境内で行動を起こすエージェント的行動の評価も包含している。
歴史的背景とベンチマーク
エバルの系譜は、人工知能における古典的なベンチマークスイートに遡ることができる。例えば、1950年にアラン・チューリングによって提案されたチューリングテストは、機械知能の初期の概念的な評価であったが、現代の実践ではほとんど使用されていない。その後の数十年間で、研究者たちはチェス、自然言語処理、コンピュータビジョンなどの分野向けにタスク固有のベンチマークを開発した。2010年代のニューラルネットワークと深層学習の出現は、画像分類用のImageNetのような大規模ベンチマークの作成を加速させ、これは深層学習革命において極めて重要な役割を果たした。
言語モデルについては、2018年から2019年頃に導入されたGLUE(General Language Understanding Evaluation)やその後継であるSuperGLUEのようなベンチマークが、感情分析、質問応答、テキスト含意などをカバーする標準化されたタスクセットを提供した。これらのベンチマークにより、研究者は共通の基盤でモデルを比較することができた。しかし、大規模言語モデルが規模と能力を増すにつれて、これらのベンチマークは急速に飽和状態になり、より挑戦的で多様な評価セットの開発が促された。
大規模言語モデルのための現代のエバル
大規模言語モデル向けの現代のエバルは、OpenAI、Anthropic、Google DeepMind、学術機関などの組織によって構築されることが多い。これらは通常、一連のプロンプトまたはタスクで構成され、それぞれにルーブリックまたは期待される結果、そしてスコアリングメカニズムが含まれる。スコアリングは自動化される場合があり、例えば、正確な文字列一致のチェック、別のモデルを審判として使用する、生成されたコードに対して単体テストを実行するなどがある。また、有用性、無害性、誠実さなどの次元に沿って応答の質を評価する人間の評価者を含む場合もある。
一般的なタイプのエバルは、既存の試験や厳選された知識ベースから派生した多肢選択式または短答式の質問セットである。例えば、MMLU(Massive Multitask Language Understanding)には、数学、歴史、法律、医学などの科目にわたる数千の質問が含まれる。もう一つの広く使用されているエバルは、HellaSwagベンチマークであり、物語の最も妥当な続きをモデルに選択させることで常識推論をテストする。これらのベンチマークは、モデルの知識と推論能力の広範な尺度を提供する。
エージェント的および行動的エバル
AIエージェント(ツールを使用したり、ウェブを閲覧したり、ソフトウェア環境と対話したりできるシステム)の台頭に伴い、エバルはエージェント的行動をカバーするように拡張されている。これらの評価は、多くの場合、エージェントをシミュレートされた環境に配置し、マルチステップタスクを完了し、エラーから回復し、長い期間にわたって指示に従う能力を測定する。例えば、エバルはエージェントにフライトの予約、コードの作成と実行、仮想オフィスのナビゲーションを要求し、最終的な結果が期待される結果と一致するかどうかで成功を定義する場合がある。
行動的エバルは、安全性と整合性も探る。これには、違法行為の指示、偏った発言、個人情報の漏洩など、有害な出力を引き出すように設計された敵対的テストが含まれる。人間のテスターが意図的にモデルを壊そうとするレッドチーミングは、自動化されたエバルの設計に情報を提供することが多い補完的なアプローチである。これらのエバルの結果は、人間のフィードバックからの強化学習(RLHF)や憲法的AIなどの技術の使用を導き、モデルの挙動を調整する。
エバルの構築と実行
実際には、エバルの構築にはいくつかのステップが含まれる。まず、実務者は範囲を定義する:アプリケーションにとって重要な能力や挙動は何か?次に、典型的な入力とエッジケースを表すテストケースのセットをキュレーションまたは生成する。各テストケースについて、スコアリング関数を指定する。これは、単純な完全一致、意味的類似性スコア、ルーブリックベースの人間による評価、またはプロンプトに従って応答を評価する審判モデルへの呼び出しである可能性がある。
エバルの実行は通常自動化され、開発ワークフローに統合される。新しいモデルバージョンがトレーニングされたり、プロンプトが変更されたりすると、エバルスイートが実行され、結果がベースラインと比較される。これにより、チームは回帰(変更が一部のメトリクスを改善するが他を悪化させるケース)を検出できる。多くの組織は、時間の経過とともに結果を記録する内部エバルプラットフォームを維持し、さまざまなカテゴリにわたるモデルの挙動の詳細な分析を可能にしている。
エバルにおける重要な課題は、過学習を防ぐことである。モデルがエバルデータで直接トレーニングされた場合、その性能は実世界の一般化を反映しない可能性がある。これを軽減するために、エバルセットはトレーニングから除外されることが多く、新しいバージョンが定期的にリリースされる。さらに、ベンチマーク飽和(モデルがほぼ完璧なスコアを達成する現象)は、より難しいベンチマークの作成や、動的または敵対的な評価方法の使用につながっている。
人間による評価の役割
自動スコアリングの進歩にもかかわらず、人間による評価はAI品質の多くの側面でゴールドスタンダードのままである。人間の評価者は、トーン、創造性、文化的適切性など、アルゴリズムで捉えるのが難しい微妙な品質を判断できる。しかし、人間による評価は費用がかかり遅いため、例えば、出力のサブセットを検証したり、審判モデルのトレーニングデータを作成したりするために、控えめに使用されることが多い。
近年では、大規模言語モデルを審判として使用することが一般的になっている。強力なモデルが、ルーブリックに従って別のモデルの出力を評価するようにプロンプトされ、その判定は信頼性を確保するために人間の判断と比較される。このアプローチはスケーラブルであるが、研究者が引き続き研究している独自のバイアスを導入する。
産業と研究におけるエバル
主要なAIラボとクラウドプロバイダーは、エバルを業務の中心的な部分にしている。例えば、AnthropicはClaudeモデルの詳細な評価(安全性と能力の評価を含む)を公開している。OpenAIはGPTモデル用のエバルをリリースし、Google DeepMindは研究コミュニティに多数のベンチマークを提供している。EleutherAI Language Model Evaluation Harnessなどのオープンソースの取り組みは、任意のモデルで幅広い標準ベンチマークを実行するためのツールを提供している。
エバルは、規制や政策の議論でも役割を果たしている。政府が人工知能の統治方法を検討するにつれて、モデルの挙動を測定および検証する能力が重要になる。標準化されたエバルは、認証やコンプライアンスの基盤として機能する可能性があるが、普遍的な標準はまだ採用されていない。
課題と将来の方向性
エバルの分野は、いくつかの未解決の問題に直面している。一つは、長期的な計画や常識など、スコアに簡単に還元できない能力を測定することの難しさである。もう一つは、グッドハートの法則のリスクであり、メトリクスを最適化することが真の性能を向上させるのではなく、メトリクスをゲームすることにつながる。また、継続的に更新されたり、予測不可能な方法で世界と対話したりするモデルを評価する方法の問題もある。
将来の方向性には、モデルの挙動に基づいてテストセットが変化する、より動的で適応的なエバルの開発や、エバルをトレーニングループ自体に統合し、モデルがエバル性能のために直接最適化されるようにすることが含まれる。研究者はまた、人間の価値観との整合性を測定し、明示的にトレーニングされていない創発的能力を検出するためのエバルの使用を探求している。
要約すると、エバルはAIの責任ある開発のための不可欠なインフラストラクチャである。これらは、改善を促進し、安全性を確保し、AIシステムへの信頼を構築する経験的フィードバックループを提供する。技術が進化するにつれて、それを評価する方法とツールも進化し、エバルは活発で重要な研究と実践の分野であり続けるだろう。