DALL-E 2は、OpenAIによって開発され、2022年にリリースされたテキストから画像を生成するモデルである。自然言語による記述(プロンプトと呼ばれる)から、デジタル画像を生成する。このモデルは、元のDALL-Eの後継であり、より高解像度でより現実的な画像を生成できるように設計されており、概念、属性、スタイルを組み合わせる能力を持つ。
DALL-E 2は、新しいコンテンツの作成に焦点を当てた生成的人工知能のより広い分野の一部である。このモデルは、拡散ベースのアーキテクチャを採用しており、前身の自己回帰的アプローチとは異なる。名前は、ピクサーのロボットWALL-Eとスペインのシュルレアリスム画家サルバドール・ダリの結合語である。
歴史と背景
元のDALL-Eは、2021年1月5日のブログ投稿でOpenAIによって発表され、GPT-3の改変版を使用して画像を生成した。2022年4月6日、OpenAIは後継のDALL-E 2を発表し、より現実的な画像を生成し、概念を組み合わせる能力を強調した。当初、倫理的および安全性の懸念から、アクセスは事前に選ばれたユーザーに限定され、研究プレビューとして提供された。2022年7月20日、DALL-E 2はベータ版に入り、待機リストに登録された1,000万人が招待された。ユーザーは毎月無料で限られた数の画像を生成でき、追加のクレジットを購入できた。2022年9月28日には待機リストの要件が撤廃され、モデルは一般に公開された。
2022年11月初旬、OpenAIはDALL-E 2をAPIとして公開し、開発者がモデルをアプリケーションに統合できるようにした。APIは画像ごとのコストベースで動作し、解像度に応じて価格が異なり、エンタープライズ顧客にはボリュームディスカウントが提供される。マイクロソフトは、DALL-E 2をDesignerアプリとBingおよびMicrosoft Edge内のImage Creatorツールに統合した。2024年2月、OpenAIはDALL-Eが生成した画像に透かしの追加を開始し、に埋め込むメタデータを埋め込んだ。これには、C2PA(コンテンツの出所と信頼性を確保するための連合)標準を使用したとされる。
技術
DALL-E 2は、35億のパラメータを使用し、前身の120億よりも少ない。自己回帰的なトランスフォーマーではなく、CLIP画像埋め込みに条件付けられた拡散モデルを採用している。推論時には、事前のモデルがCLIPテキストの埋め込みからこれらの画像埋め込みを生成する。このアーキテクチャは、数か月後に公開されたStable Diffusionと類似している。このモデルは、ニューラルネットワークと機械学習の技術を活用し、人工知能研究の進歩に基づいている。
CLIP(対照型言語-画像プレトレーニング)は、インターネットから4億の画像対を訓練した別のモデルである。これは、DALL-E 2の出力の理解と評価に重要な役割を果たし、プロンプトに最もよく一致する画像を選択する。拡散プロセスは、ランダムノイズを反復的に洗練して、CLIPの埋め込みにガイドされて一貫性のある画像を生成する。
能力
DALL-E 2は、写真的な画像、絵画、絵文字など複数のスタイルで画像を生成できる。また、オブジェクトを操作し、再配置し、明示的な命令なしで新しいインジターズにデザイン要素を正しく配置できる。例えば、だいこん大根が鼻をかんだり、ラテを飲んだり、一輪車に乗ったりするプロンプトに、モデルはしばしばハンケチ、手、足を妥当な位置に配置する。また、ホリデーに関連するプロンプトにクリスマスのイメージを追加したり、言及されていないの影をレンダリングしたり、適切な詳細を推測することもできる。
このモデルは、視覚とデザインのトレンドに対する広範な理解を示し、様々な視点からの任意の説明に対しても画像を生成できるが、まれに失敗することもある。その視覚フィンズの能力は、人間の知能を測定するためによく使われるテストであるレーヴェンマトリックスを解くに十分である。
画像の変更
DALL-E 2は、既存の画像のバリエーションを生成でき、画像を編集して変更または拡張するアーリもできる。インペインティングとアウトペインティングの能力は、元の画像のコンテキストを使用して、プロンプトに従って一貫したメディアで欠落部分を埋める。例えば、ユーザーは画像に新しいサブジェクトを挿入したり、元の境界を超えて拡張したりできる。OpenAIによれば、アウトペインティングは、影、反射、テクスチャなどの既存の視覚要素を考慮する。
影響と遺産
DALL-E 2は、その後のテキストから画像生成の開発に影響を与えた。これには、2023年10月にリリースされたDALL-E 3が含まれ、ChatGPTに統合され、後に2025月の3月にGPT Imageに置き換るされた。このモデルはまた、生成AIの能力と倫理的な影響に関する広範な議論、誤用への懸念、透かしなどの出所対策の必要性にも貢献した。