英語からの翻訳

2022年4月にOpenAIが公開したDALL-E 2は、自然言語のプロンプトから深層学習を用いてデジタル画像を生成するテキストから画像へのモデルであり、特にCLIP埋め込みに条件付けられた拡散モデルを特徴とする。

DALL-E 2は、OpenAIによって開発されたテキストから画像を生成するモデルであり、2022年4月6日に元のDALL-Eの後継として発表された。これは、プロンプトとして知られる自然言語の記述からデジタル画像を生成するために深層学習の手法を用いる。このモデルは、前身よりも高解像度でより現実的な画像を生成するように設計されており、概念、属性、スタイルを組み合わせる能力を持つ。その名前は、ピクサーのロボットキャラクターWALL-Eとスペインのシュルレアリスム芸術家サルバドール・ダリのかばん語である。

歴史と背景

元のDALL-Eは、2021年1月5日のブログ投稿でOpenAIによって公開され、画像を生成するためにGPT-3の修正版を使用した。DALL-E 2は2022年4月6日に発表され、2022年7月20日にベータ版へ移行し、100万人の待機リスト登録者に招待状が送られた。この段階では、ユーザーは毎月一定数の画像を無料で生成でき、追加分を購入することができた。アクセスは以前、倫理と安全性への懸念から、研究プレビューとして事前に選ばれたユーザーに限定されていた。2022年9月28日、DALL-E 2はすべての人に公開され、待機リストの要件は撤廃された。2022年11月初旬、OpenAIはDALL-E 2をAPIとしてリリースし、開発者がモデルを自社のアプリケーションに統合できるようにした。マイクロソフトはその後、BingとMicrosoft Edgeに含まれるDesignerアプリとImage CreatorツールにDALL-E 2を実装した。APIは画像ごとのコスト制で動作し、価格は画像解像度によって異なり、エンタープライズ顧客にはボリュームディスカウントが提供される。2024年2月、OpenAIはDALL-E生成画像に透かしの追加を開始し、コンテンツ真正性イニシアチブが推進するC2PA(コンテンツの出所と真正性のための連合)標準のメタデータを含めた。

技術

DALL-E 2は35億のパラメータを使用し、前身よりも少ない数である。自己回帰型トランスフォーマーではなく、CLIP画像埋め込みに条件付けられた拡散モデルを採用している。推論時には、これらの画像埋め込みは、事前モデルによってCLIPテキスト埋め込みから生成される。このアーキテクチャは、数か月後にリリースされたStable Diffusionと同じである。このモデルは、Generative AIDeep learningにおける初期の研究、特にOpenAIなどによるTransformer (architecture)アーキテクチャの開発に基づいている。最初の生成的プレトレーニング済みトランスフォーマー(GPT)モデルは2018年にOpenAIによって開発され、2019年にGPT-2、2020年にGPT-3へとスケールアップされ、1750億のパラメータを持つ。DALL-E 2の拡散アプローチは、離散VAEと120億パラメータのデコーダーのみのトランスフォーマーモデルを使用した元のDALL-Eの自己回帰方式とは異なる。

機能

DALL-E 2は、フォトリアリスティックな画像、絵画、絵文字など、複数のスタイルで画像を生成できる。画像内のオブジェクトを操作および再配置でき、明示的な指示なしに新しい構図でデザイン要素を正しく配置できる。このモデルは、視覚的およびデザインのトレンドについて幅広い理解を示し、さまざまな視点からの多種多様な任意の記述に対して、まれな失敗を除いて画像を生成できる。その視覚的推論能力は、人間の知能を測定するためにしばしば実施される視覚テストであるレイヴンの漸進的マトリクスを解くのに十分である。DALL-E 2は、既存の画像のバリエーションを生成したり、インペインティングとアウトペインティングを通じて編集したりするなど、画像の修正もサポートしている。これらの機能は、画像からのコンテキストを使用して、指定されたプロンプトに従って、元の画像と一致するメディアで欠落領域を埋める。例えば、アウトペインティングは、影、反射、テクスチャなどの既存の視覚要素を考慮して、画像を元の境界を超えて拡張できる。

影響と遺産

DALL-E 2は、テキストから画像への生成における重要な進歩を示し、オープンベータとその後の待機リスト撤廃を通じて、この技術をより広い一般に提供した。そのリリースはGenerative AIへの関心を刺激し、2023年10月にChatGPTにネイティブに統合されPlusおよびEnterprise顧客向けにリリースされたDALL-E 3など、その後の分野の発展に影響を与えた。DALL-E 3は後にマイクロソフトのBing Image CreatorとCopilotに統合され、2025年3月にはChatGPTでGPT Imageのネイティブ画像生成機能に置き換えられた。このモデルの拡散ベースのアーキテクチャは、Stable Diffusionなどの他のシステムにも影響を与え、創造的タスクのためのMachine learningアプリケーションの急速な進化に貢献した。DALL-E 2の安全性へのアプローチは、研究プレビュー中のアクセス制限やその後の透かしなど、生成モデルの責任ある展開の前例を設定した。

評価と懸念

DALL-E 2のリリースは、かなりの一般および学術的な注目を集め、AI生成画像の創造的可能性と倫理的課題の両方を浮き彫りにした。懸念には、誤解を招くコンテンツ作成への悪用の可能性、著作権問題、アーティストやデザイナーへの影響が含まれた。OpenAIの段階的な展開は、初期の制限と待機リストを伴い、これらの懸念を反映していた。このモデルがテキストプロンプトから現実的な画像を生成する能力は、出所と真正性に関する疑問も提起し、2024年のC2PA透かしの採用につながった。これらの課題にもかかわらず、DALL-E 2はその技術的成果とユーザーフレンドリーなインターフェースで広く賞賛され、非専門家の間でテキストから画像への生成を普及させるのに貢献した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-image·openai·deep-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴