Agentic harness(常简称为“the harness”)是一种软件环境,将原始的语言模型转化为可工作的智能体:它提供循环机制,向模型提供上下文,执行其工具调用,返回结果,并重复此过程直至任务完成。该术语在2025-2026年间成为AI工程领域的核心概念,因为人们逐渐认识到,智能体在现实世界中的能力有很大一部分并非仅来自模型本身,而是取决于其周围harness的质量,,同一模型在不同的harness中运行时,表现可能平庸,也可能卓越。
Harness提供的功能
- 智能体循环。 提示模型,解析其动作,执行动作,将结果附加到上下文,重复进行。终止条件、重试和错误处理均在此层实现。
- 工具。 文件编辑、shell执行、浏览、代码运行、搜索,,通过函数调用或模型上下文协议等协议暴露。
- 上下文管理。 模型每轮看到的内容:系统提示、上下文工程、当上下文窗口填满时的摘要或压缩,以及跨会话的记忆。
- 子智能体与编排。 生成子智能体以进行并行或专门化工作,并合并其结果,,这是多智能体系统以及gauntlet循环等模式的底层基础。
- 安全护栏。 权限、沙箱、人工批准门控和审计日志;2026年OpenAI与Hugging Face事件(参见2026 OpenAI agent cyberattacks)使harness级别的隔离成为首要安全议题。
示例
编码harness是最为显眼的:Claude Code、OpenAI的Codex CLI、Cursor的智能体模式,以及OpenHands和Aider等开源项目。评估harness(用于运行SWE-bench等基准测试的脚手架)是将同一理念应用于测量,这也是为何基准结果常报告为“使用harness X”:分数随harness变化,而不仅仅取决于模型。
为何该术语重要
“Harness”将过去常常混为一谈的两个层次区分开来:模型能力(权重)和智能体能力(权重+环境)。模型发布日益引用依赖harness的结果,提示模式是专门为特定harness编写的(gauntlet循环明确要求harness),实验室也针对自身harness微调模型,,Anthropic的Claude模型与Claude Code即为典型配对。相关术语“智能体脚手架”(agent scaffolding)有时与之互换使用,但脚手架通常指提示词与工作流结构,而harness则指完整运行时。