英語からの翻訳

ARC-AGI(抽象推論コーパス)は、Francois Cholletによって作成されたベンチマークであり、記憶に抵抗するように設計された新しい視覚パズルを通じて、AIシステムの抽象推論と一般化能力をテストすることを目的としている。

ARC-AGIは、Artificial General Intelligenceのための抽象化と推論コーパス(Abstraction and Reasoning Corpus for Artificial General Intelligence)の略称であり、Keras深層学習フレームワークの作者であるFrançois Cholletによって作成され、2019年に初めて公開されたベンチマークである。これは、視覚的なグリッドパズルで構成され、解答者は少数の入力・出力グリッドペアの例から抽象的な変換規則を推論し、その規則を新しいテストグリッドに正しく適用しなければならない。

目的

ARC-AGIは、多くのAIベンチマークが、どれほど困難であっても、真の推論や一般化ではなく、大規模なパターンマッチングや記憶によって実質的に解ける可能性があるという観察への直接的な対応として設計された。Cholletは、付随する論文「知能の測定について(On the Measure of Intelligence)」において、知能は固定された学習可能なスキルに対する生の性能ではなく、新奇なタスクにおけるスキル獲得効率によって測定されるべきだと主張し、ARC-AGIのパズルを、それぞれが明確で一般化可能な抽象化を必要とし、対称性、数え上げ、包含、物体の永続性など、人間が早期に獲得する概念を利用するように設計した。これらは、記憶されたパターンで近道することが難しいように意図的に選ばれている。

AIシステムにとっての難しさ

公開から数年間、ARC-AGIは古典的な機械学習と初期の大規模言語モデルの両方に対して顕著に耐性を示し、有能なGPT-4クラスのモデルでさえ公開評価セットのごく一部しか解けなかった一方、子供を含むほとんどの人間は特別な訓練なしにパズルの大半を解いた。従来のベンチマークMMLUなど)での強い性能とARC-AGIでの弱い性能との間のこのギャップは、質的に異なる推論能力なしのスケーリングだけでは、人間らしい一般化に到達するには不十分であるという証拠として頻繁に引用された。

推論モデルによる進歩

このギャップは、拡張されたテスト時計算思考連鎖スタイルの探索を使用する推論モデルの出現によって大幅に縮小した。特に、OpenAIのo1とその後継モデルは、以前の非推論モデルよりも大幅に高いARC-AGIスコアを記録したが、パズルごとの推論コストはしばしば著しく高かった。この進歩は、事前学習のスケールだけではなく、推論時の探索と熟考が、より一般的な推論への有意義な経路であるという証拠とみなす者もいた一方で、その成果の一部は、モデルが公開リーダーボードデータからARC-AGI風のパズルパターンを学習したことを反映しており、完全に一般的な推論の改善ではないと警告する者もいた。

形式と賞金

ARC-AGIのパズルは意図的に部分的に非公開とされ、未公開の評価セットが保持されており、以前の静的ベンチマークを損なったデータ汚染問題を制限することを特に目的としている。関連する公開コンペティションであるARC Prizeは、未公開セットで強い性能を達成するシステムに賞金を提供し、学界と産業界の両方の参加者を引き付け、初期バージョンが飽和に近づくにつれて、ARC-AGI-2を含むより難しい後継バージョンを定期的にリリースしている。

重要性

ARC-AGIは、AGIのタイムラインや、現在の深層学習アプローチが汎用知能に到達するのに十分かどうかに関する議論で頻繁に引き合いに出される。その設計目標、すなわち記憶に抵抗しつつ人間には容易であること、が、人間とAIの性能の大きなギャップが高性能な大規模言語モデルの時代に入っても持続した稀なベンチマークとなっているためである。これは、スケールとデータだけに影響されやすい他のベンチマークとは異なり、真の推論の進歩を示す最も注目されている指標の1つであり続けている。

カテゴリ:ai-evaluation·artificial-general-intelligence
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴