DALL-Eは、OpenAIによって開発されたText-to-image generation生成モデルのシリーズであり、芸術家サルバドール・ダリとピクサーのロボットキャラクターWALL-Eの合成語として名付けられた。最初のDALL-Eは2021年1月に発表され、120億パラメータのTransformer (architecture)モデルであり、GPT-3と同じアーキテクチャファミリーに基づいていた。これは、画像生成を離散画像トークン上のシーケンス予測問題として扱うことでテキスト記述から画像を生成するよう訓練されており、後にこの分野を支配することになる拡散技術を使用していなかった。
バージョン間の進化
2022年4月にリリースされたDALL-E 2は、元の離散トークンアプローチを、CLIPによって導かれる拡散ベースのアーキテクチャに置き換えた。CLIPはOpenAIの共同画像テキスト埋め込みモデルであり、これにより大幅に高解像度でより写実的な画像が生成され、テキスト記述から既存画像の一部を編集する「インペインティング」機能も導入された。DALL-E 2の公開ベータ版と、その後の2022年後半の一般提供は、主流メディアの注目を集め、MidjourneyやStable Diffusionなどの同時期のリリースとともに、AI生成画像を初めて主流の一般認識に持ち込んだと広く評価されている。2023年にリリースされ、ChatGPTに直接統合されたDALL-E 3は、プロンプトへの忠実性と画像内のテキストレンダリングを改善し、ChatGPT自体を使用して短いユーザープロンプトを拡張・洗練させてから画像モデルに渡すようにした。
評価と影響
DALL-Eのリリースは、視覚的創造的仕事の未来に関する広範な公開討論を引き起こし、AI支援アートやデザインを試すユーザーからの熱意と、プロのイラストレーターや写真家からの、著作権で保護された画像が同意なしにトレーニングデータに使用されることに関する懸念と置き換えの恐れの両方を生み出した。この論争は、生成AI業界全体にわたるより広範なAI著作権訴訟に発展した。このシステムはまた、偽情報や非同意の画像を生成する可能性についても精査され、OpenAIはコンテンツフィルターを実装し、一定期間、公的人物の認識可能な顔の生成を制限した。
遺産
DALL-Eは、GANに関する初期の学術研究や後のオープンな競合他社とともに、テキストから画像への生成を研究上の好奇心ではなく主流の消費者・商業技術として確立したモデルの1つとして一般的に評価されている。その成功はOpenAIのより広範なマルチモーダル戦略に直接貢献し、後にGPT-4やその後のモデルに統合された画像理解・画像生成機能に情報を提供し、プロンプト作成を視覚的だけでなくテキスト的な生成AIシステムにも関連するスキルとして普及させるのに役立った。