Anthropic计算机使用功能发布

译自英文

2024年10月,Anthropic为Claude推出了计算机使用功能,使AI能够通过解读屏幕内容并模拟键盘和鼠标输入来操作桌面界面。

2024年10月,Anthropic为其Claude系列大语言模型推出了“计算机使用”功能。该功能允许应用程序调用Claude API,尝试通过Claude对屏幕内容的解读以及键盘和鼠标输入的模拟,来对应用程序进行导航控制。这标志着Generative AI在AI代理能够以类似人类的方式与图形用户界面交互方面迈出了重要一步。

该功能是Anthropic将Claude从聊天机器人交互扩展到代理工具的更广泛努力的一部分。此前,Claude于2023年3月作为基于AI的聊天机器人发布,并于2024年6月引入了工件功能。计算机使用旨在让Claude仅利用屏幕上的视觉信息和模拟输入事件,来执行填写表单、浏览网站和操作软件等任务。

技术基础

计算机使用依赖于Claude处理屏幕截图并生成操作的能力。模型接收屏幕图像,识别相关元素,并输出鼠标点击、按键或滚动操作等命令。这种方法不同于依赖API或辅助功能树的传统自动化。Anthropic在各种桌面环境上训练了该模型,以提高泛化能力。

底层架构基于Transformer (architecture)模型,该模型也用于其他Large language model系统。Claude的训练使用宪法,这是Anthropic开发的一种用于提高道德和法律合规性的技术。计算机使用功能最初通过Claude API提供,允许开发者将其集成到自己的应用程序中。

能力与局限性

在初始版本中,计算机使用可以执行搜索网页、填写表单和导航多步骤工作流等任务。Anthropic报告称,该模型可以以中等准确度完成简单任务,但对于复杂或高风险操作尚不可靠。公司强调该功能是实验性的,并建议进行人工监督。

一个显著的局限性是模型在陌生界面或屏幕布局变化时容易出错。Anthropic还指出,计算机使用可能容易受到提示注入攻击,即网页中嵌入的恶意指令可能影响模型的操作。公司建议开发者实施安全措施。

与其他AI系统的比较

计算机使用使Anthropic与其他探索代理能力的AI开发者处于同一行列。OpenAIGoogle DeepMind也展示了能够与软件交互的模型,但Anthropic的方法侧重于基于屏幕的控制,而非API集成。这使其适用于没有编程接口的遗留系统和应用程序。

该功能是Artificial intelligence系统能够自主操作计算机这一趋势的一部分。与仅生成文本的Machine learning模型不同,计算机使用要求模型理解空间布局并执行顺序操作。这需要在视觉理解和决策方面取得进展。

开发者采用与生态系统

2024年10月发布后,开发者开始将计算机使用集成到各种工具中。它被用于自动化数据输入、测试软件和管理工作流。该功能对于需要与多个应用程序交互的任务特别有用,例如将电子表格中的数据复制到网页表单中。

Anthropic提供了文档和示例,帮助开发者入门。API允许对模型的操作进行细粒度控制,包括暂停和恢复任务的能力。一些开发者将计算机使用与其他Claude功能(如工件)结合,以创建更复杂的应用程序。

后续发展

计算机使用功能随着时间的推移而演变。2025年2月,Anthropic发布了Claude Code,这是一个用于编码任务的基于终端的代理工具。虽然Claude Code侧重于基于文本的交互,但计算机使用在图形环境中仍然相关。2025年8月,Anthropic发布了Claude for Chrome,这是一个浏览器扩展,允许Claude浏览网站并代表用户点击和填写表单。该扩展利用了类似的屏幕解读技术。

2026年1月,Anthropic推出了Claude Cowork,这是一个面向非技术用户的图形工具。Cowork为Claude提供了对沙盒shell和用户选定文件夹的访问权限,允许模型读取、写入和编辑文件,执行代码,并链接多步骤任务。虽然Cowork并不完全依赖计算机使用,但它与让Claude在用户计算机上操作软件的目标一致。

安全与伦理考量

计算机使用的引入引发了安全问题。由于模型可以控制桌面界面,它可能被利用来执行未经授权的操作。Anthropic实施了安全措施,例如要求用户确认敏感操作,并限制模型对某些系统功能的访问。

提示注入攻击是一个特别令人担忧的问题。2025年8月,Anthropic报告称,在Claude for Chrome中经过缓解措施后,此类攻击的成功率为11.2%。公司继续研究提高鲁棒性的方法。对Deep learningNeural network安全的更广泛影响在学术界和工业界进行了讨论。

影响与反响

计算机使用的发布在科技媒体中得到了广泛报道。它被视为AI代理发展中的一个里程碑,这些代理能够与数字世界交互。一些观察者将其与Chess computer等AI在受限环境中展示能力的早期努力进行比较,但指出计算机使用解决了一个更普遍和非结构化的问题。

Anthropic的举措也加剧了AI公司之间的竞争。MicrosoftGoogle正在将AI集成到其操作系统和生产工具中,而Amazon Web Services和其他云提供商则提供AI服务。计算机使用为Anthropic在代理AI领域提供了独特的优势。

未来方向

截至2026年,计算机使用仍在不断完善中。Anthropic计划提高模型的准确性、速度和处理复杂界面的能力。公司还探索将计算机使用与其他代理功能(如Claude Code和Cowork)结合,以创建更无缝的自动化。

计算机使用的发展是Generative AI系统能够在世界中采取行动(而不仅仅是生成文本)的更广泛运动的一部分。MIT CSAILStanford AI Lab等机构的研究人员研究了类似方法。长期目标是创建能够以最少人工干预处理各种基于计算机任务的AI助手。

Anthropic的计算机使用功能代表了使AI更加实用和交互方面的一个显著进步。通过让Claude操作桌面界面,它为自动化和辅助开辟了新的可能性,同时也引发了关于安全和控制的重要问题。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·anthropic·computer-use·ai-agents
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史