2020年6月、OpenAIはGPT-3 APIを立ち上げ、その第3世代大規模言語モデルへの商用アクセスを提供しました。このリリースはArtificial intelligenceの商業化における転換点となり、最先端のLarge language model向けの広く利用可能な有料サービスとしては初期の例の一つでした。このAPIにより、外部の開発者や企業はGPT-3を製品に統合できるようになり、その後のGenerative AIブームを促進する一因となりました。
GPT-3 APIは、2017年にGoogleの研究者らによって導入されたTransformer (architecture)アーキテクチャに基づいて構築されました。GPT-3自体は1750億のパラメータを持つDeep learningモデルであり、多様なインターネットテキストのコーパスで訓練されました。これは、タスク固有の訓練なしにテキスト生成、翻訳、質問応答などのタスクを実行でき、その能力は少数ショット学習として知られていました。APIは、このモデルへのアクセスをクラウドエンドポイント経由で提供し、モデルをローカルで実行するよりも簡素なインターフェースを実現しました。
背景
OpenAIは2015年12月にサンフランシスコで非営利のAI研究組織として設立され、共同議長をイーロン・マスクとサム・アルトマンが務めました。その憲章は、人工汎用知能が全人類に利益をもたらすことを確保することを目的としていました。2019年、OpenAIは「上限付き」営利構造へ移行し、OpenAI LPを設立して投資を集め、競争力のある報酬を提供しました。この構造変更は、GPT-3のようなモデルの訓練に必要な莫大な計算コストを賄うために重要であり、大規模なインフラストラクチャを必要としました。
APIのアイデアは、OpenAIが安全性の監視を維持しながらモデルを収益化しようとしたことから生まれました。GPT-3 APIのプライベートベータは2019年11月に開始され、公開版は2020年6月に続きました。APIは、2019年7月に発表されたMicrosoftからの10億ドルの投資に続き、MicrosoftのクラウドプラットフォームであるMicrosoft Azure上でホストされました。この提携により、GPT-3の訓練と展開に必要な計算リソースが提供されました。
機能と能力
GPT-3 APIは、テキスト生成と補完のための複数のエンドポイントを公開しました。ユーザーはプロンプトを送信でき、モデルは温度、top-k、top-pなどのパラメータでランダム性と多様性を制御しながら、続きを返しました。APIはカスタムタスク用のファインチューニングもサポートしましたが、初期リリースはプロンプトベースの対話に焦点を当てていました。
開発者は、小さな「Ada」モデルから完全なGPT-3「Davinci」モデルまで、複数のモデルサイズから選択でき、遅延と精度のバランスを取ることができました。APIは、コンテンツ作成、チャットボット、コード生成、セマンティック検索などのユースケースをサポートしました。これは少数ショット学習で注目され、プロンプト内のいくつかの例を与えるだけで、GPT-3は追加の訓練なしに新しいタスクを実行でき、従来のMachine learningアプローチからの転換を示しました。
商業的影響
GPT-3 APIはOpenAIにとって商業的な突破口となり、継続的な収益モデルを確立しました。2021年半ばまでに、数千人の開発者と数百の企業がAPIを使用し、処理されたトークンに基づく価格設定が行われました。この成功は、OpenAIのその後の製品、特に2022年11月にリリースされたChatGPTへの道を開き、大規模な一般採用を促進し、OpenAIを主要なAI企業にしました。
APIは競争も促進しました。AnthropicやAI21 Labsなどの企業はすぐに自社の言語モデルAPIを立ち上げ、Amazon Web Services、Google Cloud、Oracle Cloud Infrastructureなどのクラウドプロバイダーは機械学習サービスを拡大しました。このエコシステムは、ソフトウェア開発からマーケティングに至るまで、生成AIの産業への統合を加速させました。
技術アーキテクチャ
GPT-3は、元のtransformer設計の進化であるデコーダーのみのtransformerアーキテクチャを使用したNeural networkでした。これはマルチヘッドアテンションと位置エンコーディングを採用してシーケンスを処理し、大規模なテキストコーパスでの教師なし学習を使用して訓練されました。モデルの1750億のパラメータは当時としては巨大であり、専門的な訓練インフラストラクチャを必要としました。
OpenAIは訓練にAzureベースのスーパーコンピューティングプラットフォームを使用し、数千のGPUを活用しました。API自体はHTTPリクエストを介して提供され、APIキーによる認証が行われました。内部的には、モデルはNVIDIA GPU上に展開されましたが、OpenAIは後にMicrosoftとカスタムシリコンを模索しました。API設計は、ChatGPTに使用されるReinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)ファインチューニング手法など、その後の取り組みに影響を与えました。
遺産と広範な文脈
GPT-3 APIは、高度なAIモデルへの商用アクセスが実行可能であることを実証し、業界を研究専用から製品提供へと転換させました。これは、GPT-4やマルチモーダルシステムなどのモデルがオンデマンドで利用可能になる、より広範なAPIエコシステムの先駆けとなりました。この動きはまた、誤用と安全性の問題を提起し、OpenAIは利用ガイドラインとコンテンツフィルターを実装するに至りました。
この立ち上げは、Large language modelの能力への関心の高まりと同時期に起こり、Generative AIを主流の分野として確立するのに貢献しました。Google DeepMindやAnthropicなどの競合他社が独自のモデルを進化させる一方で、APIは中央管理を維持しながらアクセスを民主化する前例を設定しました。今日、GPT-3 APIはAIの進化における歴史的なマイルストーンであり、実験的研究から商用製品への移行を浮き彫りにしています。