2024年10月、Anthropicは大規模言語モデルClaudeシリーズに「コンピューター使用」機能を導入した。この機能により、アプリケーションはClaude APIを呼び出し、Claudeが画面内容を解釈し、キーボードとマウスの入力をシミュレーションすることで、アプリケーションへのナビゲーション制御を試みることができる。これは、Generative AIにおいて、人間のようにグラフィカルユーザーインターフェースと対話できるAIエージェントへの重要な一歩となった。
この機能は、AnthropicがClaudeをチャットボットの対話からエージェンティックツールへと拡張する広範な取り組みの一部であった。これは、2023年3月のAIベースのチャットボットとしてのClaudeのリリースと、2024年6月のアーティファクトの導入に続くものであった。コンピューター使用は、Claudeがフォームへの記入、ウェブサイトのナビゲーション、ソフトウェアの操作などのタスクを、画面上の視覚情報とシミュレートされた入力イベントのみを使用して実行できるように設計された。
技術的基盤
コンピューター使用は、Claudeがスクリーンショットを処理し、アクションを生成する能力に依存している。モデルは画面画像を受け取り、関連する要素を特定し、マウスクリック、キーストローク、スクロールアクションなどのコマンドを出力する。このアプローチは、APIやアクセシビリティツリーに依存する従来の自動化とは異なる。Anthropicは、一般化を向上させるために、さまざまなデスクトップ環境でモデルを訓練した。
基礎となるアーキテクチャは、他のLarge language modelシステムでも使用されるTransformer (architecture)モデルに基づいている。Claudeの訓練は、Anthropicが倫理的および法的なコンプライアンスを向上させるために開発した手法である憲法を使用している。コンピューター使用機能は当初、Claude APIを通じて利用可能であり、開発者が独自のアプリケーションに統合できるようにした。
機能と制限
初期リリースでは、コンピューター使用はウェブ検索、フォームへの記入、複数ステップのワークフローのナビゲーションなどのタスクを実行できた。Anthropicは、モデルが単純なタスクを中程度の精度で完了できるが、複雑または高リスクの操作にはまだ信頼性がないと報告した。同社は、この機能が実験的であり、人間の監視を推奨すると強調した。
顕著な制限の1つは、モデルが不慣れなインターフェースや画面レイアウトが変更された場合にエラーを起こしやすいことであった。Anthropicはまた、コンピューター使用が、ウェブページに埋め込まれた悪意のある指示がモデルのアクションに影響を与える可能性があるプロンプトインジェクション攻撃に対して脆弱である可能性があると指摘した。同社は開発者に安全策を実装するよう助言した。
他のAIシステムとの比較
コンピューター使用は、エージェンティック機能を探求する他のAI開発者と並んでAnthropicを位置づけた。OpenAIとGoogle DeepMindもソフトウェアと対話できるモデルを実証していたが、AnthropicのアプローチはAPI統合ではなく画面ベースの制御に焦点を当てていた。これにより、プログラムインターフェースのないレガシーシステムやアプリケーションに適用可能となった。
この機能は、コンピューターを自律的に操作できるArtificial intelligenceシステムへのトレンドの一部であった。テキストのみを生成するMachine learningモデルとは異なり、コンピューター使用はモデルが空間レイアウトを理解し、順次アクションを実行することを要求した。これには、視覚的理解と意思決定の進歩が必要であった。
開発者の採用とエコシステム
2024年10月のローンチ後、開発者はコンピューター使用をさまざまなツールに統合し始めた。これは、データ入力の自動化、ソフトウェアのテスト、ワークフローの管理に使用された。この機能は、スプレッドシートからウェブフォームへのデータコピーなど、複数のアプリケーションとの対話を必要とするタスクに特に有用であった。
Anthropicは、開発者が始めるためのドキュメントと例を提供した。APIは、タスクの一時停止と再開の機能を含む、モデルのアクションに対する細かい制御を可能にした。一部の開発者は、コンピューター使用をアーティファクトなどの他のClaude機能と組み合わせて、より洗練されたアプリケーションを作成した。
その後の展開
コンピューター使用機能は時間とともに進化した。2025年2月、Anthropicはコーディングタスク用のターミナルベースのエージェンティックツールであるClaude Codeをリリースした。Claude Codeはテキストベースの対話に焦点を当てていたが、コンピューター使用はグラフィカル環境に関連性を保った。2025年8月、AnthropicはClaude for Chromeをリリースした。これは、Claudeがウェブサイトを閲覧し、ユーザーに代わってクリックやフォームへの記入を実行できるブラウザ拡張機能である。この拡張機能は、同様の画面解釈技術を活用した。
2026年1月、Anthropicは非技術ユーザーを対象としたグラフィカルツールであるClaude Coworkを導入した。CoworkはClaudeにサンドボックス化されたシェルとユーザー選択のフォルダーへのアクセスを提供し、モデルがファイルの読み取り、書き込み、編集、コードの実行、マルチステップタスクの連鎖を可能にした。Coworkはコンピューター使用のみに依存していなかったが、ユーザーのコンピューター上でソフトウェアを操作できるようにするという目標を共有していた。
セキュリティと倫理的考慮事項
コンピューター使用の導入はセキュリティ上の懸念を引き起こした。モデルがデスクトップインターフェースを制御できるため、不正なアクションを実行するために悪用される可能性があった。Anthropicは、機密操作にはユーザー確認を要求し、特定のシステム機能へのモデルのアクセスを制限するなどの安全策を実装した。
プロンプトインジェクション攻撃は特に懸念事項であった。2025年8月、Anthropicは、Claude for Chromeでの緩和策後、そのような攻撃が11.2%の確率で成功したと報告した。同社は堅牢性を向上させるための研究を継続した。Deep learningとNeural networkの安全性への広範な影響は、学術および業界のサークルで議論された。
影響と評価
コンピューター使用のローンチは、テクノロジーメディアで広く取り上げられた。これは、デジタル世界と対話できるAIエージェントの開発におけるマイルストーンと見なされた。一部の観察者は、これをChess computerやAIが制約された環境で能力を実証した他の分野での初期の取り組みと比較したが、コンピューター使用がより一般的で構造化されていない問題に対処していると指摘した。
Anthropicの動きは、AI企業間の競争も激化させた。MicrosoftとGoogleはAIをオペレーティングシステムと生産性ツールに統合しており、Amazon Web Servicesや他のクラウドプロバイダーはAIサービスを提供していた。コンピューター使用は、エージェンティックAI分野でAnthropicに独自の提供物を与えた。
将来の方向性
2026年現在、コンピューター使用は引き続き改良されている。Anthropicは、モデルの精度、速度、複雑なインターフェースを処理する能力を向上させる計画を立てていた。同社はまた、コンピューター使用をClaude CodeやCoworkなどの他のエージェンティック機能と組み合わせて、よりシームレスな自動化を作成する方法を探求した。
コンピューター使用の開発は、テキストを生成するだけでなく、世界でアクションを実行できるGenerative AIシステムへの広範な動きの一部であった。MIT CSAILやStanford AI Labなどの機関の研究者は、同様のアプローチを研究した。長期的な目標は、人間の介入を最小限に抑えて、幅広いコンピューターベースのタスクを処理できるAIアシスタントを作成することであった。
Anthropicのコンピューター使用機能は、AIをより実用的でインタラクティブにする上での顕著な進歩を表していた。Claudeがデスクトップインターフェースを操作できるようにすることで、自動化と支援の新しい可能性を開き、同時に安全性と制御に関する重要な問題を提起した。