TD-Gammon 是一个计算机西洋双陆棋程序,于20世纪90年代由 IBM 托马斯·J·沃森研究中心的 Gerald Tesauro 开发。其名称源于它使用了通过时序差分学习(特别是 TD-Lambda)训练的人工神经网络。它探索了人类未曾追求的策略,并推动了正确西洋双陆棋打法的理论进展。1993年,TD-Gammon(2.1版)通过150万局自我对弈训练,达到了略低于当时顶尖人类西洋双陆棋选手的水平。1998年,在一场100局系列赛中,它以仅8分的差距输给了世界冠军。它对某些开局策略的非传统评估已被专家棋手接受并采纳。TD-Gammon 常被视为强化学习和神经网络早期成功的典范,并在深度 Q 学习和 AlphaGo 的论文中被引用。
对弈与学习算法
在对弈过程中,TD-Gammon 在每一步会检查所有可能的合法走法及其所有可能的回应(前瞻搜索),将每个产生的棋盘位置输入其评估函数,并选择导致得分最高的棋盘位置的走法。在这方面,TD-Gammon 与几乎所有其他计算机棋盘游戏程序并无不同。TD-Gammon 的创新在于它如何学习其评估函数。
TD-Gammon 的学习算法包括在每步之后更新其神经网络中的权重,以减少其对前几步棋盘位置的评估与当前步棋盘位置评估之间的差异,因此称为“时序差分学习”。任何棋盘位置的得分是一组四个数字,反映程序对每种可能游戏结果的概率估计:白方正常获胜、黑方正常获胜、白方赢得双倍局、黑方赢得双倍局。对于游戏的最终棋盘位置,算法会与实际游戏结果进行比较,而不是使用其自身对棋盘位置的评估。
TD-Gammon 的核心是一个具有3层的神经网络。输入层有两种类型的神经元。一种类型编码棋盘位置:非负整数,范围从0到15,表示每个棋盘位置上的白方或黑方棋子数量,每种有99个输入神经元,总计198个神经元。另一种类型编码先前在 Neurogammon 中使用的手工特征,包括人类专家使用的标准概念,如“先进锚点”、“封锁强度”、“主场强度”以及“孤子”(单棋子)被击中的概率。隐藏层包含隐藏神经元,后期版本中数量更多。输出层包含4个神经元,表示网络对当前棋盘可能导致结果的概率(“权益”)估计:白方正常获胜、白方双倍局获胜、黑方正常获胜、黑方双倍局获胜。西洋双陆棋中的全胜极为罕见,因此 Tesauro 选择不表示它。
每步之后,学习算法根据以下规则更新每个权重:w_{t+1} - w_t = alpha (Y_{t+1} - Y_t) sum_{k=1}^{t} lambda^{t-k} grad_w Y_k,其中 alpha 是学习率,Y_t 是第 t 步的评估值,lambda 是衰减参数。研究发现,选择较小的 lambda 能提供大致相同的性能,而较大的 lambda 会降低性能。因此,在1992年之后,TD-Gammon 使用 lambda = 0 进行训练,退化为标准 TD 学习,这节省了2倍的计算量。
开发历史
1.0版使用简单的1层搜索:每一步走法由神经网络评分,并选择得分最高的走法。2.0版和2.1版使用2层搜索:首先进行1层分析以排除不太可能的走法(“前向剪枝”),然后仅对可能的走法进行2层极小极大分析,根据对手的21种可能骰子结果(非双倍结果权重是双倍结果的两倍)按概率加权选择最佳走法。3.0版和3.1版使用3层搜索,使用21^2 = 441种可能骰子结果而不是21种。最后一个版本3.1是专门为1998年 AAAI 冠军大厅展览赛中对阵 Malcolm Davis 而训练的。它以-8分落败,主要归因于一次失误,当时 TD-Gammon 选择加倍,结果被对手赢得双倍局,损失达到-32分。
实验与训练阶段
与之前的神经网络西洋双陆棋程序(如同样由 Tesauro 编写的 Neurogammon)不同,后者由专家通过提供每个位置的“正确”评估来训练程序,TD-Gammon 最初是“无知识”编程的。在早期实验中,仅使用原始棋盘编码且无人工设计特征,TD-Gammon 达到了与 Neurogammon 相当的水平:即中级人类西洋双陆棋选手的水平。
尽管 TD-Gammon 自行发现了有洞察力的特征,Tesauro 仍想知道使用像 Neurogammon 那样的人工设计特征是否能提高其表现。确实,使用专家设计特征进行自我训练的 TD-Gammon 很快超越了所有以前的计算机西洋双陆棋程序。它在约150万局自我对弈后停止改进,使用三层神经网络,其中198个输入单元编码专家设计特征,80个隐藏单元,以及一个输出单元表示预测的获胜概率。
西洋双陆棋理论的进展
TD-Gammon 完全通过自我对弈(而非模仿学习)进行训练,使其能够探索人类以前未考虑或错误排除的策略。它对非传统策略的成功对西洋双陆棋社区产生了重大影响。1991年末,Bill Robertie、Paul Magriel 和 Malcolm Davis 受邀与 TD-Gammon(1.0版)对弈。共进行了51局,TD-Gammon 以-0.25分每局落败。Robertie 认为 TD-Gammon 达到了强人类选手的水平,其非传统走法后来被专家采纳,改变了对开局策略的理解。
遗产与影响
TD-Gammon 被广泛认为是机器学习和人工智能领域的里程碑,证明了神经网络可以通过自我对弈和时序差分学习来掌握复杂的策略游戏。它的成功启发了后来在强化学习方面的工作,包括深度 Q 网络和 AlphaGo 的开发。该程序能够发现人类遗漏的新策略,凸显了神经网络在游戏对弈中超越人类直觉的潜力,并且它仍然是人工智能研究史上的经典范例。