英語からの翻訳

LLM評価は、しばしばevalsと略され、大規模言語モデルの品質、能力、安全性を測定するために用いられる手法の集合であり、静的ベンチマークスイートから人間の嗜好アリーナ、LLM-as-judgeスコアリングまで多岐にわたる。

LLM評価は、一般に「evals」と呼ばれ、大規模言語モデルの能力、品質、信頼性、安全性を測定するために用いられる方法とインフラストラクチャを指す。LLMがますます幅広いタスクに適用されるにつれて、評価は狭い学術的演習から、AI研究所内の主要な実践的学問へと成長してきた。なぜなら、evalsは何が公に報告されるかを決定し、開発者によるモデル選択を導き、ますますトレーニング自体にフィードバックされるようになっているからである。

静的ベンチマークスイート

最も伝統的な評価形態は、知識に関するMMLU、コーディングに関するHumanEvalSWE-bench、抽象的推論に関するARC-AGIなど、既知の正解を持つ固定のベンチマークデータセットに対してモデルを実行するものである。これらのスイートは繰り返し実行するのが安価で、直接的な数値比較が可能だが、モデルがテストセットと重複する可能性のあるますます大規模なウェブスクレイプでトレーニングされるにつれて、ベンチマークの飽和とトレーニングデータの汚染に悩まされる。

人間の好みに基づくアリーナ

有用性、文章品質、トーンなど、多くの価値あるLLMの特性は単純な正解スコアリングに抵抗するため、LMArena(旧Chatbot Arena)のようなプラットフォームは、モデル出力間の大規模なブラインドの一対一人間比較を収集し、Eloスタイルのランキングを計算する。このアプローチは集約的な人間の好みをよく捉えるが、冗長性や同意性などのスタイル的特性を報酬とし、それが必ずしもより深い能力や正しさを追跡しないこと、またプラットフォームのユーザー分布に特化してモデルを調整することでゲーム可能であることが批判されている。

LLM-as-judge

新しいアプローチでは、あるLLMが別のLLMの出力を評価し、正しさ、有用性、またはルーブリックへの準拠について応答をスコアリングする。これは、人間による評価が大規模には遅く高価だからである。LLM-as-judgeメソッドは多くのタスクで人間の判断をかなりよく近似でき、人間の評価者がカバーできるよりもはるかに多くの例に評価をスケールさせることを可能にするが、自身のモデルのバイアスと盲点を継承し、長いまたはより自信に満ちた回答を好む傾向を含み、評価されるモデルが真に改善するのではなくジャッジをゲームする出力を生成することを学ぶ場合に悪用される可能性がある。

ドメイン固有および安全性の評価

一般的な能力に加えて、評価はますます狭い特性をカバーする:事実質問におけるハルシネーション率、ジェイルブレイクプロンプトインジェクションへの感受性、人口統計グループ間のバイアス、そしてAI安全性に関連する危険な能力評価、例えばモデルがサイバー攻撃や生物兵器合成を有意義に支援できるかどうかなどである。AnthropicOpenAIを含む研究所は、責任あるスケーリングへのコミットメントに関連する展開前テストの一部としてそのような評価を実行し、ブレッチリー宣言後に設立された政府AI安全研究所を含む第三者機関は、フロンティアリリースの独立した評価を実施する。

課題

評価は持続的な困難に直面している:ベンチマークとアリーナは、何が測定されているかを研究所が知るとゲーム可能であり、これはモデル開発に適用されたグッドハートの法則の一種である;汚染は静的スコアの妥当性を損なう;そして、有用性、誠実さ、無害性など、ユーザーが気にする多くの、時には矛盾する品質を捉える単一の数値は存在しない。これにより、分野は複数の方法を組み合わせた評価ポートフォリオ、質問を更新する継続的な「リビングベンチマーク」、そして孤立した質問応答よりも実際の展開をよりよく反映する実世界、タスクベース、およびエージェントベースの評価へのより大きな重点へと押し進められている。

重要性

evalsはどのモデルが最良と認識されるかを形成し、RLHFや報酬モデリングなどの技術を通じてますますトレーニングに直接フィードバックされるため、評価方法論の設計は、あまり目立たないが、分野の主要モデルが実際にどのように振る舞うかの重要な推進要因となっている。

カテゴリ:ai-evaluation·industry
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴