OpenAI DALL-E 3 の発表

英語からの翻訳

2023年10月にOpenAIがリリースしたDALL-E 3は、ChatGPTに統合されたテキストから画像を生成するモデルであり、PlusおよびEnterpriseユーザー向けに提供され、高度なプロンプト追従と画像生成機能を備えています。

DALL-E 3は、OpenAIによって開発されたテキストから画像を生成するモデルであり、2023年10月にDALL-Eシリーズの第3世代としてリリースされた。ChatGPT PlusおよびChatGPT Enterpriseの顧客向けにChatGPT内でネイティブに利用可能となり、2023年11月初旬にはOpenAIのAPIおよびLabsプラットフォームを通じてより広範なアクセスが提供された。このモデルは、前身であるDALL-EおよびDALL-E 2の基盤の上に構築され、深層学習を用いて自然言語のプロンプトからデジタル画像を生成する。

DALL-Eという名称は、ピクサーのロボットキャラクターであるWALL-Eと、スペインのシュルレアリスム画家サルバドール・ダリの合成語である。初版は2021年1月に発表され、続いてDALL-E 2が2022年4月に発表された。DALL-E 3は、プロンプトのニュアンスと詳細を理解する点で大きな進歩を表しており、MicrosoftのBing Image Creatorツールに統合され、Microsoft Copilotはこのモデル上で動作している。

歴史と背景

OpenAIは2021年1月5日のブログ投稿で初めてDALL-Eを公開し、GPT-3の修正版を使用して画像を生成した。DALL-E 2は2022年4月6日に発表され、より高解像度で現実的な画像を生成し、概念、属性、スタイルを組み合わせるように設計された。2022年7月20日にベータ版が開始され、1万人のウェイトリスト登録者に招待状が送られ、2022年9月28日に一般公開された。

2023年9月、OpenAIはDALL-E 3を発表し、従来の反復よりも大幅に多くのニュアンスと詳細を理解できるとされた。このモデルは2023年10月にChatGPT PlusおよびEnterprise顧客向けにChatGPT内でネイティブにリリースされた。2023年11月初旬にはOpenAI APIおよびLabsプラットフォームを通じて利用可能となった。MicrosoftはこのモデルをBingのImage Creatorツールに実装し、Designerアプリへの統合を計画した。

2024年2月、OpenAIはDALL-Eが生成した画像に透かしを追加し始め、Content Authenticity Initiativeが推進するC2PA(コンテンツの出所と信頼性のための連合)標準のメタデータを含めた。2025年3月、DALL-E 3はChatGPT内でGPT Imageのネイティブな画像生成機能に置き換えられた。

技術

最初の生成的事前学習トランスフォーマー(GPT)モデルは、2018年にOpenAIによってTransformerアーキテクチャを使用して開発された。GPT-1は2019年にGPT-2へとスケールアップされ、2020年には1,750億パラメータを持つGPT-3が登場した。DALL-E 3は深層学習の方法論を使用しているが、OpenAIのDALL-E 3に関する技術報告書にはトレーニングや実装の詳細は含まれておらず、改善されたプロンプト追従能力に焦点を当てている。

DALL-Eのアーキテクチャ

オリジナルのDALL-Eには3つのコンポーネントがあった。離散VAE、GPT-3に類似した1,200億パラメータの自己回帰型デコーダーのみのTransformerモデル、そしてCLIPの画像エンコーダーとテキストエンコーダーのペアである。離散VAEは画像をトークンのシーケンスに変換し、また逆に変換する。これはTransformerが画像データを直接処理しないために必要である。

Transformerへの入力は、トークン化された画像キャプションのシーケンスに続いてトークン化された画像パッチである。キャプションは英語であり、語彙サイズ16,384のバイトペアエンコーディングでトークン化され、最大256トークンの長さである。各画像は256×256のRGBであり、32×32のパッチ(各4×4)に分割され、各パッチは離散変分オートエンコーダーによって語彙サイズ8,192のトークンに変換される。

CLIP(対照言語-画像事前学習)はDALL-Eと並行して開発され、画像とテキストキャプションのペア4億件でトレーニングされた。これは、32,768個のランダムに選択されたキャプションのリストから、画像に最も適切なキャプションを予測することによってDALL-Eの出力をランク付けし、より大きな初期リストをフィルタリングして最も近い一致を選択する。

DALL-E 2およびDALL-E 3のアーキテクチャ

DALL-E 2は35億パラメータを使用しており、前身よりも少ない。また、CLIP画像埋め込みに条件付けられた拡散モデルを採用し、推論中にCLIPテキスト埋め込みからこれらの埋め込みを生成する事前モデルを持つ。このアーキテクチャは、数か月後にリリースされたStable Diffusionに類似している。

DALL-E 3はこの拡散ベースのアプローチを継続しているが、プロンプト追従が強化されている。公開された技術的詳細はないが、このモデルは複雑なプロンプトを追従し、画像内のテキストをより一貫性のある正確な方法で生成する精度の向上を示している。

機能

DALL-Eは、フォトリアリスティックな画像、絵画、絵文字など、複数のスタイルで画像を生成できる。オブジェクトを操作および再配置でき、明示的な指示なしに新しい構成にデザイン要素を正しく配置できる。例えば、大根が鼻をかんだり、ラテをすすったり、一輪車に乗ったりするように求められた場合、DALL-Eはしばしばハンカチ、手、足を妥当な場所に描く。

このモデルは、特定のプロンプトなしに適切な詳細を推測して空白を埋めることができ、例えば、祝祭に関連するプロンプトにクリスマスのイメージを追加したり、言及されていない画像に影を適切に配置したりする。DALL-Eは視覚的およびデザインのトレンドについて幅広い理解を示し、さまざまな視点からの多種多様な任意の説明に対して、まれな失敗を除いて画像を生成できる。

ジョージア工科大学インタラクティブコンピューティング学部の准教授であるMark Riedlは、DALL-Eが概念をブレンドできることを発見し、これは人間の創造性の重要な要素であると述べた。その視覚的推論能力は、人間の知能を測定するためにしばしば実施される視覚テストであるレイヴンの漸進的マトリックスを解くのに十分である。

DALL-E 3は、前身よりも複雑なプロンプトをより正確かつ詳細に追従し、画像内のテキストをより一貫性のある正確な方法で生成できる。ChatGPT Plusに統合されており、ユーザーは会話形式のプロンプトを通じて画像を生成できる。

画像の修正

既存の画像が与えられると、DALL-E 2およびDALL-E 3は、元の画像に基づいて個々の出力として画像のバリエーションを生成できるだけでなく、画像を修正または拡張するために編集することもできる。インペインティングおよびアウトペインティング機能は、画像のコンテキストを使用して、指定されたプロンプトに従って元の画像と一貫性のあるメディアで欠落領域を埋める。

例えば、これは画像に新しい被写体を挿入したり、画像を元の境界を超えて拡張したりするために使用できる。OpenAIによると、アウトペインティングは、影、反射、テクスチャを含む画像の既存の視覚要素を考慮して、一貫性を維持する。

統合と利用可能性

DALL-E 3は2023年10月にChatGPT PlusおよびChatGPT Enterprise顧客向けにChatGPT内でネイティブにリリースされた。OpenAIのAPIおよびLabsプラットフォームを通じた利用可能性は2023年11月初旬に続いた。MicrosoftはこのモデルをBingのImage Creatorツールに実装し、Microsoft CopilotはDALL-E 3上で動作し、Designerアプリへの統合を計画した。

APIは画像ごとのコストベースで動作し、価格は画像解像度によって異なる。OpenAIのエンタープライズチームと協力している企業にはボリュームディスカウントが提供される。2025年3月、DALL-E 3はChatGPT内でGPT Imageのネイティブな画像生成機能に置き換えられた。

安全性と出所

OpenAIは、有害なコンテンツの制限や透かしの追加など、DALL-Eモデルに関する安全性の懸念に対処してきた。2024年2月、OpenAIはDALL-Eが生成した画像に透かしを追加し始め、Content Authenticity Initiativeが推進するC2PA標準のメタデータを含めた。これはAI生成画像の出所を検証するのに役立つ。

遺産

DALL-E 3は、Generative AIおよびText-to-image generation技術におけるマイルストーンを表し、Deep learningおよびNeural networkモデルにおける初期の研究に基づいている。ChatGPTのようなLarge language modelシステムとの統合は、言語と画像生成の収束を示している。このモデルの機能は、GPT Imageや他の画像生成システムなど、その後の分野の発展に影響を与えた。

2023年10月のDALL-E 3のリリースは、よりアクセスしやすくニュアンスのあるAI画像生成への移行を示し、クリエイティブ産業、コンテンツ作成、デジタルアートに影響を与えた。Microsoft CopilotおよびBing Image Creatorでの使用は、そのリーチをより広いオーディエンスに拡大した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:openai·text-to-image·generative-ai·deep-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴