英語からの翻訳

DALL-E 2は、OpenAIによって開発されたテキストから画像を生成するモデルで、2022年4月に公開され、拡散モデルとCLIP埋め込みを使用して自然言語のプロンプトから現実的な画像を生成します。これは元のDALL-Eの後継であり、後にDALL-E 3が続きました。

DALL-E 2は、OpenAIによって開発されたテキストから画像を生成するモデルであり、プロンプトとして知られる自然言語の記述からデジタル画像を生成する。2022年4月6日に発表され、元のDALL-Eモデルの後継として、より現実的な画像を高解像度で生成できるように設計され、概念、属性、スタイルを組み合わせる能力を備えていた。このモデルは深層学習の手法、具体的にはCLIP画像埋め込みに条件付けられた拡散モデルを使用しており、2022年中に段階的に一般公開された。

DALL-Eという名前は、アニメーションのロボットキャラクターであるWALL-Eと、スペインのシュルレアリスム芸術家サルバドール・ダリのかばん語である。このモデルの開発は、生成的人工知能における重要な一歩を示し、機械学習ニューラルネットワークの初期の進歩に基づいていた。

歴史と背景

DALL-Eの最初のバージョンは、2021年1月にOpenAIによって発表され、GPT-3の修正版を使用して画像を生成した。2022年4月6日、OpenAIは後継としてDALL-E 2を発表し、現実感と解像度の向上を強調した。アクセスは、倫理的および安全性の懸念から、当初は事前に選ばれたユーザーに研究プレビューとして限定されていた。2022年7月20日、モデルはベータ段階に入り、100万人の待機リストに登録された個人に招待状が送られ、毎月一定数の画像を無料で生成し、追加クレジットを購入できるようになった。2022年9月28日に待機リストの要件が撤廃され、DALL-E 2はすべての人に開放された。

2022年11月初旬、OpenAIはDALL-E 2をAPIとしてリリースし、開発者がモデルをアプリケーションに統合できるようにした。APIは画像ごとのコストベースで動作し、価格は解像度によって異なり、エンタープライズクライアント向けのボリュームディスカウントも提供された。マイクロソフトは後に、DesignerアプリとBingおよびMicrosoft Edge内のImage CreatorツールにDALL-E 2を実装した。2023年9月、OpenAIはDALL-E 3を発表し、2023年10月にChatGPTのPlusおよびEnterprise顧客向けに統合され、2025年3月にGPT Imageに置き換えられた。

技術

DALL-E 2は35億のパラメータを使用しており、前身の120億よりも少ない。自己回帰型のTransformerモデルではなく、CLIP画像埋め込みに条件付けられた拡散モデルを採用している。推論中、事前モデルがCLIPテキスト埋め込みからこれらの画像埋め込みを生成する。このアーキテクチャは、数か月後にリリースされたStable Diffusionと類似している。元のDALL-Eは、離散変分オートエンコーダを使用して画像をトークンに変換し、自己回帰型のデコーダのみのTransformerで処理し、CLIPの画像とテキストのエンコーダのペアを使用して出力をランク付けしていた。

DALL-E 2の拡散プロセスは、テキスト由来の埋め込みに導かれながら、ノイズを画像に反復的に洗練させ、高解像度の出力と一貫性のあるオブジェクト配置を可能にする。モデルのトレーニングには、画像とテキストのペアの大規模なデータセットが関与していたが、具体的な詳細は完全には開示されなかった。

機能

DALL-E 2は、フォトリアリスティックな画像、絵画、絵文字など、複数のスタイルで画像を生成できる。オブジェクトを操作および再配置でき、明示的な指示なしに新しい構図にデザイン要素を正しく配置できる。例えば、大根が鼻をかんだり、ラテをすすったり、一輪車に乗ったりするように求められた場合、モデルはハンカチ、手、足を妥当な位置に描くことが多い。また、空白を埋めることもでき、例えば、クリスマスに関連するプロンプトにクリスマスの画像を追加したり、言及されていない画像に適切な影を追加したりできる。

このモデルは、視覚およびデザインのトレンドに対する幅広い理解を示し、人間の創造性の重要な要素である概念をブレンドできる。その視覚的推論能力は、人間の知能を測定するためにしばしば実施される視覚テストであるレーヴン漸進的マトリックスを解くのに十分である。DALL-E 2は、さまざまな視点からの任意の記述に対して画像を生成でき、失敗はまれである。

画像修正

既存の画像が与えられると、DALL-E 2は元に基づく個々の出力としてバリエーションを生成でき、画像を修正または拡張するための編集も行える。インペインティングおよびアウトペインティング機能は、画像のコンテキストを使用して、指定されたプロンプトに従って欠落領域を埋める。例えば、これにより画像に新しい被写体を挿入したり、元の境界を超えて拡張したりできる。OpenAIは、アウトペインティングが画像の既存の視覚要素、影、反射、テクスチャを考慮に入れると述べた。

安全性と倫理

研究プレビュー中、OpenAIは誤用の懸念、例えば誤解を招くまたは有害なコンテンツの生成などから、DALL-E 2へのアクセスを制限した。同社は、暴力的、成人向け、または政治的なコンテンツをブロックするフィルタを実装し、2024年2月に生成画像に透かしを追加し、コンテンツ真正性イニシアチブによって推進されるC2PA標準のメタデータを含めた。これらの措置は、ディープフェイクや誤情報に関する倫理的問題に対処することを目的としていた。

遺産と影響

DALL-E 2は、その後のテキストから画像へのモデルと、より広範な人工知能研究に影響を与えた。その拡散ベースのアプローチは他のシステムによって採用され、Bing Image Creatorなどの製品への統合により、生成画像への一般のアクセスが拡大した。このモデルの成功は、深層学習注意機構の発展とともに、OpenAIのこの分野での prominence に貢献した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:text-to-image·openai·generative-ai·diffusion-model
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴