多智能体系统,在现代AI语境下,是一种架构,其中多个不同的AI智能体实例相互交互,通常通过协作、分工或相互检查工作,来完成单个智能体单独处理时效果较差的任务。每个智能体通常基于大语言模型构建,往往通过自身的系统提示词被赋予特定角色、人设或工具集,智能体之间通过传递消息、共享工作区或读写共同状态来进行通信。
多智能体系统的概念远比大语言模型古老,在分布式人工智能和强化学习研究中有着悠久历史,这些研究探讨独立智能体如何在共享环境中合作或竞争。这一理念的LLM特定版本直接源于2023年至2025年的广义智能体浪潮:随着单个智能体通过工具使用可靠地完成多步骤任务,研究人员和开发者开始组合多个智能体,以处理具有自然角色分工的任务,如软件开发、研究或辩论。
常见模式
多智能体框架中反复出现若干组织模式。在编排者-工作者模式中,一个智能体将任务分解为子任务,分派给专门的工人智能体,然后整合其结果,这种结构非常适合自然分解的任务,例如并行研究多个子主题。在辩论或批判模式中,两个或多个智能体在产生最终答案之前提出答案或相互批判推理,旨在发现单个模型可能无法自行察觉的错误。在流水线模式中,智能体按固定顺序排列,每个处理更大流程的一个阶段,例如起草智能体后接编辑智能体和事实核查智能体。某些系统还使用共享黑板或文档,多个智能体异步读写,而非直接相互传递消息。
优势与理由
支持者认为,将复杂任务划分给专门智能体,每个具有更窄的角色和相应更简单的提示词,可以比要求单个智能体同时把握整个复杂任务产生更可靠的结果,尤其适用于超出单个上下文窗口的任务,或受益于独立、低相关性尝试后再选择结果的任务。多智能体辩论和批判设置尤其被研究为减少幻觉和推理错误的方法,其前提是智能体从全新上下文审查另一智能体的输出,比原始智能体审查自身工作更可能发现错误。
局限性与批评
多智能体系统引入了自身的成本和失败模式。运行多个智能体相比单个智能体会成倍增加令牌使用量和延迟,因为每个智能体通常维护自己的上下文,并可能多次调用底层模型。协调失败也很常见:智能体可能相互误解、重复工作、陷入相互等待,或因错误在手递过程中累积而偏离原始任务,这一风险与单智能体讨论的可靠性问题密切相关。一些从业者认为,许多标榜需要多智能体的任务,可以通过一个足够强大的单智能体配合良好的提示工程和适当工具访问,以更低成本同样甚至更好地完成,这使得多智能体架构成为一种真正的工程权衡,而非严格更优的默认选择。截至2025年,多智能体框架仍是工具开发活跃领域,对于智能体应如何通信尚无单一主导标准,尽管模型上下文协议及相关标准化工具和上下文接口的努力已被一些项目扩展至智能体间通信。