Agentic AI,又称AI智能体,描述的是通过感知环境、做出决策并在一段时间内采取行动来自主追求目标的人工智能系统。这一概念扩展了智能体这一更广泛的定义,即任何感知周围环境、采取行动以实现目标,并可能通过机器学习或知识获取来提升自身表现的实体。在人工智能教科书中,人工智能领域通常被定义为对智能体的研究与设计,而目标导向行为被视为智能的核心。
智能体的范围从简单的控制系统(如恒温器)到复杂的实体(如人类、公司或国家)不等。Agentic AI特别强调主动性和持续的自主性,使其区别于仅对即时输入做出反应的反应式系统。这些智能体基于一个概括其目标的客观函数来运作,并被设计为制定和执行计划,以在完成时最大化该函数的预期值。
基于智能体的人工智能定义
Stuart Russell和Peter Norvig在其具有影响力的教科书中,将人工智能描述为对从环境中接收感知并执行动作的智能体的研究。在此框架下,智能体通过传感器感知,通过执行器行动。理性智能体会根据其感知序列、先验知识和可用动作,选择预期能最大化其性能指标的行动。理性并不要求全知或保证成功;它关注的是基于可用信息的预期结果。
在面向智能体的计算中,智能体的特征包括自主性、对环境变化的响应性以及目标导向或主动行为。一种建模方法是信念-愿望-意图(BDI)架构,它通过智能体关于世界的信息、其目标以及其已承诺的行动方案来表示智能体。该架构在理论性和应用性AI研究中都具有重要影响。
客观函数与目标规范
客观函数规定了智能体的目标。如果一个智能体始终选择能产生与其客观函数更一致结果的动作,则被认为更智能。客观函数作为成功的衡量标准,可以简单也可以复杂。例如,在围棋游戏中,客观函数可能为胜利赋值为1,失败赋值为0,而自动驾驶汽车的客观函数可能需要在安全性、速度和乘客舒适度之间取得平衡。
不同术语根据上下文描述这一概念。效用函数常用于经济学和决策理论中,表示状态的期望程度。客观函数是优化中的通用术语,而损失函数用于机器学习,其目标是最小化误差。奖励函数出现在强化学习中,适应度函数用于进化系统。目标可以显式编程,也可以通过学习或进化来诱导。
Agentic系统中的学习与适应
在强化学习中,奖励函数提供反馈,鼓励期望行为并抑制不良行为,智能体通过学习来最大化累积奖励。程序员可能使用奖励塑形来为朝向最终目标的进展提供增量奖励。进化系统使用适应度函数来确定哪些智能体更可能繁殖,类似于自然选择。Yann LeCun在2018年表示,大多数学习算法本质上都涉及最小化某个客观函数。
一些AI系统,如最近邻方法,通过类比推理而非显式目标驱动。然而,即使是这些系统,其目标也可以隐含地定义在训练数据中。传统上不被视为智能体的系统,如知识表示系统,可以被框架为以准确回答问题为目标的智能体。在生成式AI中,模仿驱动系统可以被框架为基于其模仿期望行为的接近程度来优化目标函数,如生成对抗网络中生成器试图欺骗判别器。
应用与更广泛的背景
Agentic AI与经济学中的智能体密切相关,智能体范式的各种版本在认知科学、伦理学和实践理性哲学中都有研究。这一概念也出现在跨学科的社会认知建模和计算机社会模拟中。智能体通常被示意性地描述为类似于计算机程序的抽象功能系统,其抽象描述称为抽象智能体。它们还与软件智能体相关,软件智能体是代表用户执行任务的自主计算机程序,有时被称为理性智能体,这一术语借自经济学。
现代Agentic AI实现通常基于大型语言模型和Transformer架构,使系统能够规划、使用工具并在更长时间范围内运作。MIT CSAIL、斯坦福AI实验室和伯克利AI研究等研究机构为推进这些系统做出了贡献。OpenAI、Anthropic和Google DeepMind等公司开发了将推理与行动相结合的智能体框架,尽管该领域仍在快速发展中。