アーサー・サミュエル(1901年-1990年)は、IBMに所属したアメリカのコンピュータ科学者であり、最初期の自己学習型ゲームプログラムの一つであるチェッカープレイシステムを開発し、1959年の画期的な論文で「機械学習」という用語を生み出した。
チェッカープログラム
サミュエルは1950年代にIBMでチェッカープログラムの開発を開始し、IBM 701を含む同社の初期のコンピュータ上でそれを実行した。固定された戦略を手書きでコーディングするのではなく、サミュエルはプログラムが経験を通じて改善するように設計した。プログラムは自身や人間の対戦相手と対局し、結果に基づいて位置評価関数の重みを調整し、後に強化学習として形式化されるものの初歩的な形態を用いた。1962年にテレビで放映されたデモンストレーションでは、プログラムが強い人間のチェッカープレイヤーを破り、機械が明示的に再プログラムされることなく自身の性能を向上できるという考えに広く一般の注目を集めた。
「機械学習」の造語
1959年の論文「チェッカーのゲームを用いた機械学習の研究」において、サミュエルはこの分野を「コンピュータに明示的にプログラムされることなく学習する能力を与えること」と定義し、この表現はその後数十年にわたり機械学習の標準的でありながら非公式な定義となった。この論文はまた、プログラムが連続する時間ステップでの予測を比較することで評価を調整する、後にリチャード・サットンによって形式化され命名された時間差学習に類似したアイデアを紹介しており、これは現代の強化学習の中心となる技法である。
後期の経歴と影響
サミュエルは後にスタンフォード大学で働き、ジョン・マッカーシーとともに初期のタイムシェアリングシステムに貢献し、1970年代までチェッカープログラムの改良を続けた。後のゲームプレイシステムの基準からすれば狭いものではあったが、彼のチェッカープログラムは、数十年後にAlphaGo、特にAlphaZeroなどのシステムで再浮上する自己対戦パラダイムを先取りしていた。AlphaZeroは自己対戦のみから囲碁、チェス、将棋を学習した。
遺産
サミュエルのチェッカープログラムは、強い人間のプレイヤーに挑戦できるほどゲームを学習した最初のコンピュータプログラムとして広く引用されており、彼が「機械学習」という用語を生み出したことは、その手法が単純な重み付き評価関数から21世紀の深層ニューラルネットワークや大規模言語モデルへと進化してもなお、この分野に永続する名前を与えた。機械が明示的な指示ではなく経験を通じて改善できるという彼の実証は、人工知能というより広範なプロジェクトの初期の概念実証としてしばしば引用されている。