DALL-E 1 リリース(2021年)

英語からの翻訳

DALL-E 1は、2021年1月にOpenAIによって発表され、自然言語のプロンプトから深層学習を用いてデジタル画像を生成するテキスト・トゥ・イメージモデルの最初のバージョンでした。

DALL-E 1は、DALL·Eとして表記されることもあり、OpenAIが開発したテキストから画像を生成するモデルの最初のバージョンである。2021年1月に発表され、深層学習の手法を用いて、プロンプトとして知られる自然言語の記述からデジタル画像を生成する。その名前は、ピクサーのロボットキャラクターであるWALL-Eと、スペインのシュルレアリスム芸術家サルバドール・ダリのかばん語である。

DALL-E 1は生成的人工知能における画期的な成果であり、Transformerベースのモデルがテキストの記述から一貫性のある多様な画像を生成できることを実証した。その後、2022年にDALL-E 2、2023年にDALL-E 3が後継として登場し、それぞれ写実性、解像度、プロンプトの理解度が向上した。

歴史と背景

OpenAIは2021年1月5日のブログ投稿でDALL-E 1を公開した。これは、1750億のパラメータを持つ大規模言語モデルであるGPT-3の修正版を使用して画像を生成した。このモデルは、インターネットから収集された4億の画像とテキストのペアで訓練された別のモデルであるCLIP(対照言語-画像事前学習)と並行して開発された。CLIPの役割は、32,768個のランダムに選択されたキャプションのリストから、画像に最も適切なキャプションを予測してDALL-Eの出力をランク付けし、最良の結果を選別するのに役立つことであった。

DALL-E 1のリリースは、生成的AIの能力と影響についての大きな世間の関心と議論を引き起こした。すぐに広く利用可能にはならず、倫理的および安全性の懸念から、当初は研究プレビューとしてアクセスが制限されていた。後継のDALL-E 2は2022年7月にベータ版となり、2022年9月に一般公開された。

技術

DALL-E 1は、離散変分オートエンコーダ(VAE)、120億のパラメータを持つ自己回帰型デコーダのみのTransformerモデル、そして画像とテキストのエンコーダのペアであるCLIPの3つのコンポーネントで構成されていた。Transformerは画像データを直接処理しなかったため、離散VAEが画像をトークンのシーケンスに変換し、また元に戻す役割を担った。

Transformerへの入力は、トークン化された画像キャプションのシーケンスに続いて、トークン化された画像パッチのシーケンスであった。キャプションは英語で、バイトペアエンコーディングにより語彙サイズ16,384でトークン化され、最大256トークンまで可能であった。各画像は256×256のRGB画像で、4×4ピクセルの32×32パッチに分割された。各パッチは離散VAEによって、8,192の語彙からトークンに変換された。

このアーキテクチャはGPT-3のものと類似していたが、画像生成用に適応されていた。自己回帰モデルは、テキストキャプションを条件として、画像トークンを順次予測した。対照学習に基づくCLIPは、モデルによって生成されたより大きなセットから最良の画像をランク付けして選択するために使用された。

能力

DALL-E 1は、フォトリアリスティックな画像、絵画、絵文字など、複数のスタイルで画像を生成できた。また、画像内のオブジェクトを「操作および再配置」したり、明示的な指示なしに新しい構図にデザイン要素を正しく配置したりすることができた。例えば、大根が鼻をかんだり、ラテをすすったり、一輪車に乗ったりするように描くよう求められた場合、ハンカチ、手、足を妥当な位置に描くことが多かった。

このモデルは「空白を埋める」能力を示し、特定のプロンプトなしに適切な詳細を推測した。例えば、クリスマスに関連するプロンプトにクリスマスのイメージを追加したり、影を適切に配置したりした。また、視覚的およびデザインのトレンドについて幅広い理解を示した。

DALL-E 1は、さまざまな視点から任意の記述に対して多様な画像を生成でき、失敗はまれであった。ジョージア工科大学インタラクティブコンピューティング学部の准教授であるマーク・リードルは、人間の創造性の重要な要素である概念を融合できることを発見した。その視覚的推論能力は、人間の知能を測定するためによく使用される視覚テストであるレーヴン漸進的マトリックスを解くのに十分であった。

影響と遺産

DALL-E 1は、テキストから画像を生成する技術の普及に貢献し、生成的AIのさらなる研究を促進した。その後、35億のパラメータを持つ拡散モデルを使用したDALL-E 2が続き、2023年10月にはChatGPTに統合されたDALL-E 3が登場した。マイクロソフトはBingのImage CreatorとDesignerアプリにDALL-E 3を実装し、Copilotもこれに基づいて動作する。2025年3月、DALL-E 3はChatGPT内でGPT Imageのネイティブ画像生成機能に置き換えられた。

OpenAIは2024年2月から、C2PA(コンテンツの出所と信頼性のための連合)標準のメタデータを使用して、DALL-Eが生成した画像に透かしを追加し始めた。DALL-E 1のリリースは、人工知能機械学習の発展における重要な一歩であり、その後のモデルやアプリケーションに影響を与えた。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-image·openai·deep-learning
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴