英語からの翻訳

DALL-Eは、OpenAIによって開発されたテキストから画像を生成するモデルのシリーズであり、2021年1月に初めて発表されました。深層学習技術を用いて、自然言語のプロンプトからデジタル画像を生成します。

DALL-Eは、OpenAIによって開発された一連のテキストから画像を生成するモデルであり、深層学習の手法を用いて、プロンプトとして知られる自然言語の記述からデジタル画像を生成する。最初のバージョンは2021年1月に発表され、その後2022年にDALL-E 2、2023年にDALL-E 3が続いた。この名前は、ピクサーのロボットキャラクターであるWALL-Eと、スペインのシュルレアリスム芸術家サルバドール・ダリのかばん語である。

これらのモデルは、画像、テキスト、音声などの新しいコンテンツを作成することに焦点を当てた生成的人工知能というより広い分野の一部である。DALL-Eの能力は、その後のテキストから画像を生成する技術の発展に影響を与え、さまざまな商業製品に統合されている。

歴史と背景

OpenAIは2021年1月5日のブログ投稿でDALL-Eを公開し、GPT-3モデルの修正版を使用して画像を生成した。2022年4月6日、同社はDALL-E 2を発表した。これは、より現実的な画像を高解像度で生成し、概念、属性、スタイルを組み合わせるように設計された後継モデルである。DALL-E 2へのアクセスは、倫理的および安全性の懸念から、当初は研究プレビューとして事前に選ばれたユーザーに限定されていた。2022年7月20日、このモデルはベータ版に入り、100万人の待機リストに登録された個人に招待状が送られ、月に一定数の無料画像を生成でき、追加購入も可能だった。待機リストの要件は2022年9月28日に撤廃され、モデルはすべての人に開放された。

2023年9月、OpenAIはDALL-E 3を発表した。これは、以前のバージョンよりもはるかに多くのニュアンスと詳細を理解できるものであった。2023年10月にChatGPT PlusおよびChatGPT Enterpriseの顧客向けにChatGPTにネイティブに統合され、同年11月初旬にはOpenAIのAPIおよびLabsプラットフォームを通じて利用可能になった。マイクロソフトはBingのImage CreatorツールにDALL-E 3を実装し、Designerアプリでも使用する計画を立てており、Microsoft CopilotはDALL-E 3で動作していた。2025年3月、DALL-E 3はChatGPT内でGPT Imageのネイティブ画像生成機能に置き換えられた。

2024年2月、OpenAIはDALL-Eが生成した画像に透かしを追加し始めた。これには、Content Authenticity Initiativeが推進するC2PA(コンテンツの出所と信頼性のための連合)標準のメタデータが含まれている。

技術

最初の生成事前学習トランスフォーマー(GPT)モデルは、2018年にOpenAIによってTransformerアーキテクチャを使用して開発された。2019年にGPT-2、2020年にGPT-3へと規模が拡大され、1750億のパラメータを持つようになった。DALL-Eはこの基盤の上に構築されている。

DALL-E

元のDALL-Eには3つのコンポーネントがある。離散変分オートエンコーダ(VAE)、GPT-3に類似した120億パラメータの自己回帰デコーダのみのTransformerモデル、そしてCLIPの画像とテキストのエンコーダのペアである。離散VAEは、Transformerが画像データを直接処理しないため、画像をトークンのシーケンスに変換し、また戻す。入力は、トークン化された画像キャプションのシーケンスに続いて、トークン化された画像パッチである。キャプションは英語で、バイト対符号化でトークン化され、語彙サイズは16,384で、最大256トークンまで可能である。各画像は256×256のRGBで、32×32のパッチに分割され、各パッチは4×4ピクセルで、各パッチはVAEによって8,192の語彙からのトークンに変換される。

DALL-Eは、CLIP(対照言語-画像事前学習)と並行して開発された。これは、インターネットから収集された4億組の画像とテキストキャプションで訓練された対照学習に基づく別のモデルである。CLIPは、32,768のランダムに選択されたキャプションのリストから、どのキャプションが画像に最も適切かを予測することで、DALL-Eの出力をランク付けする。訓練されたCLIPペアは、より大きな初期画像リストをフィルタリングして、テキストプロンプトに最も近いものを選択する。

DALL-E 2

DALL-E 2は35億のパラメータを使用しており、前身よりも少ない。自己回帰Transformerの代わりに、CLIP画像埋め込みに条件付けられた拡散モデルを使用する。この埋め込みは、推論中に事前モデルによってCLIPテキスト埋め込みから生成される。このアーキテクチャは、数か月後にリリースされたStable Diffusionと同じである。

DALL-E 3

DALL-E 3の技術レポートが書かれたが、訓練や実装の詳細は含まれておらず、代わりに改善されたプロンプト追従能力に焦点を当てている。

能力

DALL-Eは、フォトリアリスティックな画像、絵画、絵文字など、複数のスタイルで画像を生成できる。画像内のオブジェクトを操作および再配置し、明示的な指示なしに新しい構成でデザイン要素を正しく配置できる。例えば、大根が鼻をかんだり、ラテをすすったり、一輪車に乗ったりするように描くように求められた場合、DALL-Eはしばしばハンカチ、手、足を妥当な場所に描く。特定のプロンプトなしで適切な詳細を推測でき、例えば、クリスマスに関連するプロンプトにクリスマスの画像を追加したり、影を適切に配置したりする。DALL-Eはまた、視覚的およびデザインのトレンドについて幅広い理解を示す。

このモデルは、さまざまな視点からの多種多様な任意の記述に対して、まれな失敗を除いて画像を生成できる。ジョージア工科大学インタラクティブコンピューティング学部の准教授であるマーク・リードルは、DALL-Eが概念を融合できることを発見し、これは人間の創造性の重要な要素であると述べた。その視覚的推論能力は、人間の知能を測定するためにしばしば人間に実施される視覚テストであるレーヴン漸進的マトリックスを解くのに十分である。

DALL-E 3は、前身よりも複雑なプロンプトをより正確かつ詳細に追従し、より一貫性のある正確なテキストを生成できる。ChatGPT Plusに統合されている。

画像の修正

既存の画像が与えられると、DALL-E 2およびDALL-E 3は、元の画像に基づいて個々の出力として画像のバリエーションを生成でき、また画像を編集して修正または拡張できる。これらのモデルのインペインティングおよびアウトペインティング機能は、画像のコンテキストを使用して、指定されたプロンプトに従って元の画像と一貫したメディアで欠落領域を埋める。例えば、これは画像に新しい被写体を挿入したり、画像を元の境界を超えて拡張したりするために使用できる。OpenAIによると、アウトペインティングは、影、反射、テクスチャを含む画像の既存の視覚要素を考慮に入れる。

影響と採用

DALL-Eは商業ツールで広く採用されている。マイクロソフトはDALL-E 2をDesignerアプリと、BingおよびMicrosoft Edgeに含まれるImage Creatorツールに実装した。APIは画像ごとのコストベースで動作し、価格は画像解像度によって異なり、OpenAIのエンタープライズチームと協力する企業には数量割引が提供される。このモデルの影響は他のテキストから画像を生成するシステムにも及び、人工知能の安全性、著作権、コンテンツの出所に関する議論に貢献している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:text-to-image·openai·generative-ai·deep-learning
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴