AI Agent Coding 2025は、ソフトウェアコードの作成、テスト、デプロイを自律的に実行できる人工知能エージェントの急速な拡大を説明しており、この開発はその年のソフトウェア業界を大きく変革した。AIエージェントは、エージェンティックAIとも呼ばれ、目標を追求し、ソフトウェアやその他のツールを使用し、ある程度の自律性を持って行動を実行できる人工知能プログラムである。これは、2023年に一般的だった非エージェンティックなチャットボットや従来の機械学習アルゴリズムに見られるような、質問への回答といった狭い特定のタスクにAIを使用するツール的な使い方とは対照的である。普遍的に合意された定義は存在しないが、AIエージェントの共通の特徴には、目標指向の行動、外部ツールの使用、外部環境との相互作用と変更の能力、複数ステップのタスクの自律的な実行が含まれる。その制御フローはしばしば大規模言語モデル(LLM)によって駆動され、エージェントシステムにはメモリコンポーネント、計画ロジック、ツールインターフェース、コンポーネントを調整するためのオーケストレーションソフトウェアが含まれる場合がある。
2025年までに、Cursorなどのソフトウェア開発者向けエージェント、つまりコーディングエージェントは、AIエージェントの顕著な応用となり、自動化されたコード生成、テスト、デプロイを可能にした。このブームは、大規模言語モデルの進歩、関数呼び出しAPIの利用可能性、およびAnthropicのModel Context Protocol(MCP)のような標準化されたプロトコルによって促進され、これによりエージェントが文脈認識を得て外部ツールに作用できるようになった。「エージェンティック」という用語は2024年に研究者のAndrew Ngによって広まり、頻度が増加し、2025年半ばまでに、AIエージェントは業界レポートによると、ビデオゲーム開発、ギャンブル、暗号通貨ウォレット、ソーシャルメディアなど、さまざまな分野で適用されていた。
歴史的背景
人工エージェントの理論的基盤は、20世紀半ばにサイバネティクスと人工知能の確立とともに出現した。Oliver Selfridgeの1958年の論文「Pandemonium: A Paradigm for Learning」は、エージェント指向アーキテクチャを確立する上での重要な初期の理論的貢献であった。実世界のアプリケーション向けのエージェントの実用的な実装は、信念-欲望-意図ソフトウェアモデル(BDI)とエージェント指向プログラミングの導入後、1990年代に広く普及し始めた。ハーバード大学の教授Milind Tambeは、1990年代にはAIエージェントの定義が明確ではなかったと述べている。純粋なデジタルエージェントは監視などの目的でコンピュータインフラストラクチャに展開され、一方、実世界のセンサーとアクチュエータに接続されたエージェントは産業用制御システムでますます使用された。
初期の人工エージェントは単純なif-thenロジックを持つ傾向があり、それは時間とともに大きな決定木モデルへと拡大した。2010年代初頭までに、SiriやAlexaなどの製品がリリースされ、AIエージェントと呼ばれることもあったが、後のLLMによって実行されるエージェントの汎用推論能力を欠いていた。学者たちは2018年からLLMエージェントの研究を始めた。そのようなエージェントの展開は、OpenAIの「関数呼び出し」APIが利用可能になった2023年後半から加速し始め、特にAnthropicが2024年後半に導入したModel Context Protocol(MCP)の後でさらに加速した。MCPは、LLMエージェントが文脈認識を得て、さまざまな外部ツールを呼び出して世界に作用するための標準化された方法である。
トレーニングとテスト
研究者たちは、AIエージェントをトレーニングまたは評価するために、世界モデルと強化学習環境の構築を試みてきた。例えば、MinecraftやNo Man's Skyなどのビデオゲーム、および会社のウェブサイトのレプリカは、そのようなエージェントのトレーニングに使用されてきた。これらの環境により、エージェントは目標指向の行動を学習し、シミュレートされた環境と相互作用し、複数ステップのタスク実行を洗練することができる。コーディングの文脈では、エージェントはしばしば大規模なコードベースでトレーニングされ、教師ありファインチューニングや人間のフィードバックからの強化学習などの技術を使用して、コードを生成、テスト、デバッグする能力を向上させた。
自律能力
フィナンシャル・タイムズは、AIエージェントの自律性を自動運転車のSAE分類に例え、ほとんどのアプリケーションをレベル2またはレベル3に相当するとし、一部は高度に専門化された状況でレベル4を達成し、レベル5は理論上のものと述べた。コーディングでは、これは多くのAIエージェントが人間の監督の下で特定のタスクを処理できる一方、自動バグ修正やコードリファクタリングなどの狭い領域では少数が独立して動作できることを意味した。自律性のレベルは大きく異なり、一部のエージェントは各アクションに人間の承認を必要とする一方、コード生成からデプロイまでのワークフロー全体を介入なしに実行できるものもあった。
認知アーキテクチャ
Ken Huangは、7つの相互接続されたレイヤーで構成されるAIエージェント参照アーキテクチャを提案し、各レイヤーはその下のレイヤーの機能に基づいて構築されるとした:
- レイヤー1:基盤モデル - エージェントを駆動するデータセットを提供する。
- レイヤー2:データ運用 - ベクターデータベース、データローダー、RAGを含む、AIエージェント運用に必要なデータインフラストラクチャを管理する。
- レイヤー3:エージェントフレームワーク - AIエージェントを管理するソフトウェア。
- レイヤー4:展開とインフラストラクチャ - AIエージェントの技術的基盤。
- レイヤー5:評価と可観測性 - AIエージェントの安全性とパフォーマンス。
- レイヤー6:セキュリティとコンプライアンス - 安全な運用と規制境界への準拠のための保護フレームワーク。このレイヤーでは、AIエージェントスタックのすべてのレイヤーに埋め込まれたセキュリティとコンプライアンス機能が統合される。
- レイヤー7:エージェントエコシステム - AIエージェントと実世界のアプリケーションおよびユーザーとのインターフェースを表す。
このアーキテクチャは、特にコーディングエージェントが既存のソフトウェア開発パイプライン、バージョン管理システム、展開インフラストラクチャと統合する必要があるエンタープライズ環境で、AIエージェントを開発および展開するための構造化されたアプローチを提供した。
エージェントハーネス
エージェントハーネスは、大規模言語モデルを囲むソフトウェアレイヤーであり、AIエージェントとして機能できるようにする。これは一般的に、プロンプト、コンテキスト、ツール使用、メモリ、実行状態、運用上の制約、サンドボックス、権限、および結果の処理を管理する。ハーネスはモデルを内部および外部のコンピュータハードウェア、ソフトウェア、データファイル、データベース、ウェブブラウザ、コマンドラインインターフェース、アプリケーションプログラミングインターフェースに接続し、エージェントがこれらのリソースにアクセスして複数ステップのタスクを完了する方法を制御する。コーディングエージェントでは、ハーネスはしばしばコードエディタ、Gitなどのバージョン管理システム、クラウド展開プラットフォームとの統合を含み、エージェントがコードを書き、テストを実行し、アプリケーションを展開できるようにした。
オーケストレーションパターン
自律エージェントは、複雑なタスクを実行するために、他のエージェントや専門ツールとしばしば統合される。オーケストレーションパターンまたはワークフローとして知られるこれらの構成には、以下が含まれる:
- プロンプトチェーン:あるステップの出力が次のステップの入力として機能するシーケンス。
- ルーティング:入力を受け取って、専門の下流タスクまたはツールに指示する。
- 並列化:複数のタスクの同時実行。
- 逐次処理:事前定義されたパイプラインを通じた固定された線形のタスク進行。
- プランナー-批評家:一方のエージェントが提案を生成し、もう一方がそれを評価してフィードバックを提供し、洗練する反復パターン。
コーディングでは、オーケストレーションパターンにより、エージェントが大規模なソフトウェアプロジェクトを小さなタスクに分割し、専門のサブエージェントに割り当て、その取り組みを調整して一貫性のあるコードベースを生成できた。例えば、プランナーエージェントがアーキテクチャを設計し、コーダーエージェントが関数を書き、批評家エージェントがバグやスタイルの問題についてコードをレビューする可能性がある。
マルチモーダルAIエージェント
大規模言語モデル(LLM)に加えて、視覚言語モデル(VLM)とマルチモーダル基盤モデルをエージェントの基盤として使用できる。アレン人工知能研究所は2024年にオープンソースの視覚言語モデルをリリースした。Nvidiaは、VLM、LLM、および検索拡張生成を使用して、画像とビデオを分析できるAIエージェントを構築するためのフレームワークを開発者向けにリリースした。ビデオ検索とビデオ要約を含む。Microsoftは、画像、ビデオ、ソフトウェアユーザーインターフェースの相互作用、ロボットデータでトレーニングされたマルチモーダルエージェントモデルをリリースし、ソフトウェアとロボットを操作できると主張した。コーディングでは、マルチモーダルエージェントがユーザーインターフェースのスクリーンショットを解釈し、図を読み取り、視覚的なドキュメントを理解でき、グラフィカルアプリケーションや設計仕様での作業能力を向上させた。
アプリケーションと影響
2025年4月時点で、AP通信によると、AIエージェントの実際のアプリケーションはほとんどなかった。しかし、2025年半ばまでに状況は大きく変化していた。The InformationはAIエージェントを7つのアーキタイプに分類した:エンタープライズソフトウェア内で動作するビジネスタスクエージェント、顧客サポートのチャットボットとして機能する会話エージェント、情報の照会と分析を行うリサーチエージェント(OpenAI Deep Researchなど)、レポートを作成するためにデータを分析する分析エージェント、ソフトウェア開発者またはコーディングエージェント(Cursorなど)、特定の主題知識を含むドメイン固有エージェント、およびウェブブラウザエージェント(OpenAI Operatorなど)。
2025年半ばまでに、AIエージェントはビデオゲーム開発、ギャンブル(スポーツベッティングを含む)、暗号通貨ウォレット(暗号通貨取引とミームコインを含む)、およびソーシャルメディアで使用されていた。2025年8月、ニューヨークマガジンはこの現象を説明し、スタートアップやテック企業でのコーディングエージェントの急速な採用を強調した。ソフトウェア業界への影響は深刻だった:コーディングエージェントは、ボイラープレートコードの作成、構文エラーの修正、単体テストの実行などの日常的なタスクに必要な時間を短縮し、開発者がより高レベルの設計と問題解決に集中できるようにした。しかし、コード品質、セキュリティ脆弱性、雇用喪失に関する懸念も提起され、そのようなエージェントの適切な自律性のレベルについての議論につながった。
2025年のAIエージェントコーディングのブームは、人工知能と機械学習の進歩、特にトランスフォーマーとニューラルネットワークの開発に密接に関連していた。OpenAI、Anthropic、Google DeepMindなどの企業は、基盤となるモデルとAPIの作成で重要な役割を果たした。エコシステムはまた、Amazon Web Services、Azure、Google Cloudが提供するクラウドインフラストラクチャの恩恵を受け、エージェントのトレーニングと展開にスケーラブルな計算リソースを提供した。2025年時点で、この分野は進化を続け、より堅牢な評価方法、安全プロトコル、およびオーケストレーション技術に関する研究が進行中であり、AIエージェントがますます複雑なコーディングタスクで信頼されることを確実にしている。