计算机使用是一种能力,它让大型语言模型能够直接操作标准的图形计算机界面,查看屏幕内容并发出鼠标和键盘操作,而不是仅通过专门为其编写的专用API与软件交互。普通的工具使用要求开发者将每项能力暴露为离散的函数调用,而计算机使用则让模型能够像人类用户一样,通过查看屏幕上的内容并点击、输入或滚动来操作任何具有可视化界面的软件,包括网站、桌面应用程序和操作系统控件。
Anthropic于2024年10月公开引入了这项技术,作为其Claude模型的一项功能,描述为让模型在受控虚拟环境中截取屏幕截图、移动光标、点击按钮和输入文本。该能力依赖于模型能够解释屏幕图像并将这种理解转化为基于坐标的操作,这使其成为多模态人工智能和视觉语言模型能力的自然延伸,而非纯粹基于文本的技术。其他实验室,包括Google DeepMind和OpenAI,在2024年至2025年间也发布了类似的浏览器和计算机操作代理功能,随着这种方法成为更广泛代理浪潮中的一个既定类别。
工作原理
计算机使用循环通常遵循感知-决策-行动周期:模型被给予当前屏幕状态的截图以及用户的总体目标,它决定单个下一步操作,例如点击特定坐标、输入字符串或按键,该操作在环境中执行,然后捕获新的截图并返回给模型的上下文窗口以进行下一步决策。此循环重复,直到模型确定任务完成或达到限制。由于它通过人类使用的相同视觉和输入表面进行操作,计算机使用完全不需要应用程序暴露API,这使其能够处理遗留软件、内部企业工具以及没有公共集成的网站。
应用
计算机使用已应用于浏览器自动化以进行研究和数据录入,通过模拟真实用户的点击和输入来测试软件,以及自动化重复性办公任务,例如在从未设计为可脚本化的系统中填写表单。它通常被讨论为更广泛的人工智能代理类别在定义工具集之外的环境中的延伸,并且可以在同一代理中与更传统的工具调用结合使用,有时通过共享接口(如模型上下文协议)连接,在存在专用API时调用它,在不存在时则回退到直接界面控制。
局限性与风险
早期的计算机使用系统明显比基于API的工具使用更慢且可靠性更低,因为每个操作都需要经过完整的图像解释往返才能进行下一步,而且模型可能误点击、误读小文本或对不熟悉的界面布局感到困惑。Anthropic和其他实验室在发布时将这项能力描述为实验性的,并鉴于意外操作的风险,建议在沙盒环境中运行。其安全影响也比狭窄的工具使用更为严重,因为操作完整计算机界面的模型原则上具有与人类用户相同的可能操作范围,包括具有财务、安全或不可逆后果的操作,这是计算机使用代理被视为提示注入攻击的更高目标的原因之一,通常部署时带有防护措施、人工监督和受限执行环境。截至2025年,计算机使用仍是一个快速变化但尚未成熟的类别,随着连续几代模型的推出,准确性和可靠性显著提高,但在存在专用API的任务上仍落后于专门构建的API集成。