译自英文

Agent scaffolding是围绕模型构建的提示与工作流结构,使其充当可靠代理。它包含工具、记忆和控制流,以支持自主任务执行。

Agent scaffolding是围绕模型构建的提示词与工作流结构,旨在使其成为可靠的智能体。在人工智能中,智能体是一个感知环境、做出决策并采取行动以实现目标的系统。原始的大型语言模型生成文本;scaffolding将这种文本生成能力转化为观察、推理和行动的循环。这种结构通常包括系统提示词、一组可用工具、记忆机制以及控制流,用于决定模型何时应调用工具而非直接响应。

该术语在2020年代中期逐渐流行,因为开发者意识到,仅提示模型“执行任务”不足以应对复杂的多步骤操作。Scaffolding提供了必要的护栏、状态管理和错误处理。它区分了回答问题的聊天机器人与预订航班、编写代码或管理研究项目的智能体。这一概念与生成式人工智能和机器学习密切相关,但侧重于模型周围的工程层,而非模型内部参数。

历史背景

围绕AI系统构建结构化工作流的想法早于现代深度学习。1970年代和1980年代的早期专家系统使用基于规则的scaffolding来编码领域知识。然而,现代意义上的scaffolding随着基于Transformer的模型兴起而出现。2017年,谷歌DeepMind和多伦多大学的研究人员证明,注意力机制可以处理长距离依赖,从而实现更复杂的推理。到2020年,OpenAI的GPT-3表明大型模型可以遵循指令,但缺乏与外部系统交互的能力。

转折点出现在工具使用的引入。2021年,OpenAI发布了Codex,它可以在沙盒中执行代码。这是scaffolding的早期形式:模型生成代码,脚手架运行代码,并将输出反馈给模型。2022年,Anthropic推出了采用宪法AI方法的Claude,到2023年,OpenAI和Anthropic都发布了用于函数调用的API功能。这些API允许开发者定义模型可以调用的工具,从而正式确立了脚手架模式。

核心组件

典型的智能体脚手架由几个相互关联的部分组成。系统提示词设定智能体的角色、目标和约束。这是最直接的scaffolding形式,通常包含关于如何行为、哪些工具可用以及如何格式化响应的详细指令。工具层为模型提供外部能力:网络搜索、代码执行、数据库查询、文件操作或API调用。每个工具都以结构化格式描述给模型,通常包含名称、描述和参数模式。

记忆是另一个关键组件。由于大型语言模型具有固定的上下文窗口,scaffolding必须管理保留哪些信息。短期记忆保留最近的对话历史,而长期记忆可能使用向量数据库存储过去交互的嵌入。这允许智能体跨会话回忆事实。控制流决定循环:模型接收输入,决定是调用工具还是生成最终答案,脚手架执行工具并返回结果。此循环持续到模型发出完成信号。

工具使用与函数调用

工具使用是scaffolding最显著的方面。2023年,OpenAI在其API中引入了函数调用,允许模型输出指定工具调用的结构化JSON。Anthropic随后推出了类似功能。这些API使开发者能够轻松构建可以查询数据库、发送电子邮件或控制软件的智能体。脚手架处理实际执行,验证工具输出,并将其传递回模型。

例如,客户支持智能体可能拥有查询订单、处理退款和升级问题的工具。模型根据用户查询决定调用哪个工具。脚手架确保工具调用安全,输出在预期范围内,并且模型不会无限循环。这种模式现在在LangChain、AutoGPT和微软的Semantic Kernel等智能体框架中已成为标准,尽管scaffolding的概念与框架无关。

记忆与状态管理

记忆是简单聊天机器人与可靠智能体之间的关键区别。脚手架可以实现各种记忆类型。情景记忆存储过去的交互,使智能体能够从先前任务中学习。语义记忆保存事实和知识,通常存储在向量数据库中。程序记忆编码如何执行某些任务,可能通过提示词中的少样本示例实现。

状态管理也至关重要。执行多步骤任务的智能体需要跟踪进度、中间结果和待处理操作。脚手架可能维护一个定义有效转换的状态机。例如,研究智能体可能具有“搜索”、“阅读”、“总结”和“报告”等状态。脚手架确保智能体不会跳过步骤或不必要地重复操作。这在可靠性至关重要的生产系统中尤为重要。

规划与推理

Scaffolding通常包含显式规划机制。与其让模型以纯粹反应式方式决定行动,脚手架可以提示模型先创建计划。这有时被称为“计划与执行”。模型生成步骤列表,脚手架按顺序执行,并逐项检查。这降低了模型卡住或做出不一致决策的风险。

链式思维提示等推理技术也是scaffolding的一部分。通过要求模型“逐步思考”,脚手架鼓励更准确的推理。一些脚手架使用“反思”模式,模型审查自身输出并纠正错误。这些技术并非新事物;它们是早期AI研究中课程学习和损失函数概念的延伸,但应用于推理层面。

可靠性与安全性

Scaffolding的主要目标之一是使智能体可靠。原始模型可能产生幻觉、忽略指令或生成不安全输出。脚手架添加了护栏:输入验证、输出过滤、速率限制和人机协作检查点。对于医疗或金融等高风险应用,脚手架可能要求在执行某些操作前获得批准。

安全性也是一个关注点。脚手架可以限制模型可用的工具,防止其访问敏感数据或执行破坏性操作。它还可以监控模型行为,以检测提示注入或其他攻击的迹象。随着智能体变得更加自主,脚手架成为防止意外后果的主要防线。

框架与实现

已有多个开源和商业框架帮助开发者构建脚手架。LangChain于2022年10月由Harrison Chase发布,推广了链和智能体的概念。AutoGPT于2023年3月推出,展示了一个完全自主的智能体,可以将目标分解为子任务。微软的AutoGen于2023年发布,引入了多个模型协作的多智能体对话。

2024年,OpenAI和Anthropic都发布了智能体构建工具。OpenAI的Assistants API提供了托管脚手架,包含工具、记忆和检索功能。Anthropic的Claude Code于2025年发布,为编码智能体提供了命令行界面。这些产品抽象了大部分复杂性,但基本原则保持不变。框架的选择通常取决于具体用例、延迟要求和定制需求。

挑战与局限

尽管取得了进展,scaffolding仍面临若干挑战。上下文窗口限制仍然是瓶颈;即使上下文很大,复杂任务也可能超出模型容量。延迟是另一个问题:每次工具调用都会增加往返时间,使智能体比直接响应更慢。成本随处理的令牌数量而扩展,因此冗长的脚手架可能昂贵。错误传播是一个关注点:早期步骤中的单个错误可能级联,导致最终结果不正确。

另一个挑战是评估。如何衡量智能体的可靠性?传统指标如基准测试准确性不足。研究人员提出了AgentBench和SWE-bench等新基准,但尚未标准化。该领域仍处于早期阶段,最佳实践正在演变。

未来方向

智能体scaffolding的未来可能涉及更复杂的记忆系统、更好的规划算法以及与模型本身的更紧密集成。一些研究人员正在探索学习型脚手架,其中控制流通过强化学习优化,而非手工编码。其他人正在研究多智能体系统,其中具有不同专长的多个模型在中央脚手架下协作。

随着模型能力增强,脚手架可能变得更简单,但不会消失。即使完美的模型也需要与世界交互的方式。脚手架是模型内部表示与外部现实之间的桥梁。从这个意义上说,它是任何AI智能体的基本组成部分,随着智能体在更多领域部署,其重要性只会增长。

结论

Agent scaffolding是构建可靠AI智能体的工程学科。它涵盖提示词设计、工具集成、记忆管理和控制流。虽然底层模型强大,但它们默认并非自主;scaffolding提供了将语言模型转化为有用智能体的结构。随着领域成熟,我们可以期待更标准化的框架、更好的评估方法,以及对如何设计既有效又安全的脚手架的更深入理解。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-agents·large-language-models·software-engineering·prompt-engineering
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史