英語からの翻訳

DALL-Eは、OpenAIが開発した一連のテキストから画像を生成するモデルであり、深層学習を用いて自然言語のプロンプトからデジタル画像を生成する。最初のバージョンは2021年1月に発表され、後継のDALL-E 2とDALL-E 3はそれぞれ2022年と2023年にリリースされた。

DALL-E、DALL-E 2、およびDALL-E 3(DALL·Eと表記)は、OpenAI深層学習の手法を用いて開発したテキストから画像を生成するモデルであり、プロンプトとして知られる自然言語の記述からデジタル画像を生成する。最初のバージョンは2021年1月に発表され、その後のバージョンでは、写実性、解像度、プロンプト追従の能力が拡張された。この名前は、ピクサーのロボットキャラクターであるWALL-Eと、スペインのシュルレアリスム芸術家サルバドール・ダリのかばん語である。

歴史と背景

OpenAIは2021年1月5日のブログ投稿でDALL-Eを公開し、GPT-3の修正版を用いて画像を生成した。2022年4月6日、同社はDALL-E 2を発表した。これは、より高解像度でより写実的な画像を生成し、「概念、属性、スタイルを組み合わせる」ことができる後継モデルである。DALL-E 2へのアクセスは、倫理的および安全性の懸念から、当初は研究プレビューとして事前に選ばれたユーザーのみに制限されていた。2022年7月20日、このモデルはベータ版に入り、100万人の待機リスト登録者に招待状が送られ、毎月一定数の無料生成が可能となり、追加購入のオプションも提供された。待機リストの要件は2022年9月28日に撤廃され、このツールは誰でも利用できるようになった。

2023年9月、OpenAIはDALL-E 3を発表した。これは、以前のバージョンよりも「かなり多くのニュアンスと詳細」を理解できるものである。2023年10月にChatGPT PlusおよびEnterpriseの顧客向けにChatGPTにネイティブに組み込まれ、11月初旬にはAPIおよび「Labs」プラットフォームを通じて利用可能となった。マイクロソフトは、BingのImage CreatorツールとDesignerアプリにこのモデルを実装し、Microsoft CopilotはDALL-E 3上で動作した。2025年3月、DALL-E 3はChatGPT内でGPT Imageのネイティブ画像生成機能に置き換えられた。2024年2月、OpenAIはDALL-Eが生成した画像に透かしを追加し始め、C2PA(コンテンツの出所と信頼性のための連合)標準のメタデータを含めた。

技術

最初の生成事前学習トランスフォーマー(GPT)モデルは、2018年にOpenAIによってTransformerアーキテクチャを使用して開発された。スケーリングの反復により、2019年にGPT-2、2020年にGPT-3が生まれ、後者は1750億のパラメータを有する。DALL-Eはこの基盤の上に、バージョンごとに異なるアーキテクチャを採用して構築された。

DALL-E

オリジナルのDALL-Eは、3つのコンポーネントで構成されていた。離散変分オートエンコーダ(VAE)、GPT-3に類似した120億パラメータの自己回帰型デコーダのみのTransformerモデル、そしてCLIPの画像およびテキストエンコーダのペアである。離散VAEは、画像をトークンのシーケンスに変換し、またその逆も行った。これは、Transformerが画像データを直接処理しないため必要であった。入力は、トークン化された英語のキャプション(最大256トークン、語彙サイズ16,384)と、それに続くトークン化された画像パッチで構成されていた。各256×256のRGB画像は、4×4ピクセルの32×32パッチに分割され、各パッチは8,192の語彙を使用してトークンに変換された。

CLIP(対照言語-画像事前学習)は、DALL-Eと同時に開発・発表された別のモデルであり、対照学習に基づき、インターネットから収集された4億の画像とテキストのペアで訓練された。これは、32,768のランダムに選択されたキャプションのリストから、画像に最も適切なキャプションを予測することでDALL-Eの出力をランク付けし、より大きな初期リストをフィルタリングしてプロンプトに最も近い一致を選択した。

DALL-E 2

DALL-E 2は35億のパラメータを使用し、前身よりも少なく、自己回帰型Transformerを、CLIP画像埋め込みに条件付けられた拡散モデルに置き換えた。推論中、これらの埋め込みは、事前モデルによってCLIPテキスト埋め込みから生成された。このアーキテクチャは、数か月後にリリースされたStable Diffusionと同じものであった。

DALL-E 3

OpenAIはDALL-E 3の技術レポートを公開したが、訓練と実装の詳細は省略し、代わりに改善されたプロンプト追従能力に焦点を当てた。このモデルはChatGPT Plusに統合され、生成された画像の会話的な洗練を可能にした。

能力

DALL-Eは、写実的な画像、絵画、絵文字など、複数のスタイルで画像を生成できた。また、明示的な指示なしに、オブジェクトを「操作および再配置」し、デザイン要素を新しい構図に配置できた。BoingBoingに寄稿したThom Dunnは、大根が鼻をかんだり、ラテをすすったり、一輪車に乗ったりするように依頼されたとき、DALL-Eはしばしばハンカチ、手、足を妥当な位置に描いたと述べている。このモデルは「空白を埋める」ことができ、関連するプロンプトに対するクリスマスのイメージや、テキストに言及されていない影など、適切な詳細を推測し、視覚的およびデザインのトレンドについて幅広い理解を示した。

DALL-Eは、さまざまな視点からの多種多様な任意の記述に対して、まれな失敗を除いて画像を生成できた。ジョージア工科大学インタラクティブコンピューティング学部の准教授であるMark Riedlは、DALL-Eが概念を融合できることを発見した。これは人間の創造性の重要な要素である。その視覚的推論能力は、人間の知能を測定するためにしばしば実施される視覚テストであるレーヴン漸進的マトリックスを解くのに十分であった。

DALL-E 3は、前身よりも複雑なプロンプトをより正確かつ詳細に追従し、画像内のテキストをより一貫性があり正確に生成した。

画像の修正

既存の画像が与えられると、DALL-E 2およびDALL-E 3は、元の画像に基づく個々の出力として「バリエーション」を生成でき、また、画像を編集して修正または拡張することもできた。「インペインティング」および「アウトペインティング」の機能は、画像のコンテキストを使用して、指定されたプロンプトに従い、元の画像と一貫した媒体で欠落領域を埋めた。例えば、これにより、画像に新しい被写体を挿入したり、元の境界を超えて拡張したりすることが可能になった。OpenAIによると、「アウトペインティングは、画像の既存の視覚要素(影、反射、テクスチャを含む)を考慮して」シームレスな拡張を生成する。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:text-to-image·openai·generative-ai·deep-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴