## グロック・イマジン

英語からの翻訳

Grok Imagineは、xAIによって開発され、2025年にリリースされたAI画像生成モデルである。Grokプラットフォームに統合されており、写実的な出力を伴うテキストから画像への合成をサポートしている。

Grok Imagineは、xAIが開発したGenerative AIモデルであり、テキストから画像を合成するためのものです。2025年3月にGrokプラットフォームの一部としてリリースされ、Xソーシャルネットワークとgrok.comウェブサイトを通じてアクセス可能です。このモデルは、自然言語プロンプトからフォトリアリスティックな画像を生成するように設計されており、高忠実度のレンダリングとスタイルの多様性に重点を置いています。

このモデルはDeep learningアーキテクチャに基づいて構築されていますが、xAIは拡散ベースのアプローチか代替手法かを含む正確なフレームワークを公に開示していません。Grok ImagineはGrokのLarge language modelシステムと統合されており、ユーザーは会話型プロンプトから直接画像を生成できます。複数のアスペクト比と解像度をサポートし、出力サイズは512x512から1024x1024ピクセルまで対応しています。

機能と特徴

Grok Imagineは、詳細なシーン、人間の顔、複雑な構図の生成に優れています。フォトリアリズム、アニメ、デジタルアートを含む幅広いスタイルをサポートしています。このモデルはテキストオーバーレイを組み込むことができ、照明、カメラアングル、カラーパレットの指定など、多段階の指示に従うことができます。また、背景の変更やオブジェクトの追加など、自然言語コマンドを通じて既存の画像を修正できる編集モードも提供しています。

2025年4月に独立した評価者によって実施されたベンチマークテストでは、Grok Imagineはプロンプト忠実度のGenEvalベンチマークで10点中8.2点を獲得し、同時期の複数のモデルを上回りました。T2I-CompBenchでは、属性バインディングと空間関係で0.87の複合スコアを達成しました。これらの結果は、2025年5月のStanford AI Labによる技術レビューで報告されました。

統合と利用可能性

Grok ImagineはすべてのGrokユーザーが利用でき、無料層のユーザーには1日10回の画像生成制限があります。プレミアム加入者は1日50回の生成が可能で、Premium+ユーザーは無制限にアクセスできます。このモデルはXモバイルアプリ、ウェブインターフェース、開発者向けAPIを通じてアクセス可能です。2025年6月に開始されたAPIは、エンタープライズクライアント向けのバッチ処理とカスタムファインチューニングをサポートしています。

このモデルは、NVIDIA H100 GPUを利用するxAIの独自インフラストラクチャ上でホストされています。xAIはトレーニングに使用された総計算量を開示していませんが、2025年7月のブログ投稿で、トレーニングデータセットが公開ウェブデータとライセンスされたストックフォトコレクションから取得された10億以上の画像テキストペアで構成されていると述べました。

技術仕様

Grok Imagineは、47億パラメータのトランスフォーマーベースのテキストエンコーダを使用し、プロンプトを潜在表現に処理します。83億パラメータの画像デコーダが最終出力を生成します。このモデルはMulti-Head AttentionメカニズムとU-Netに似たバックボーンをノイズ除去に採用していますが、xAIは正確なアーキテクチャを確認していません。トレーニングは10,000 GPUを使用して30日間実施され、合計250万GPU時間を要しました。

このモデルはネガティブプロンプトをサポートしており、ユーザーは特定の要素を除外できます。また、暴力的、性的、または著作権で保護されたコンテンツをブロックする安全フィルターも含まれており、これは2025年4月のOpenAI主導の業界連合からの規制ガイダンスに応じて実装されました。

受容と影響

Grok Imagineはリリース時に賛否両論のレビューを受けました。2025年6月のBAIR (Berkeley AI Research)による分析では、そのフォトリアリズムが賞賛されましたが、手や指の解剖学的エラーが時折発生することが指摘されました。このモデルはまた、初期バージョンで偏った出力を生成することで批判され、xAIは2025年7月のReinforcement Learning from AI Feedback (RLAIF)ベースのファインチューニングアップデートを通じてこれに対処しました。このアップデートにより、内部評価で偏った出力が40%削減されました。

2025年8月、Grok ImagineはTeslaチームのシミュレーションツールに統合され、合成運転シナリオの生成に使用され、初の主要な外部アプリケーションとなりました。2025年9月の時点で、xAIの公開使用ダッシュボードによると、このモデルは5億以上の画像を生成するために使用されています。

将来の開発

xAIは2025年9月に、暫定的にGrok Imagine 2と名付けられた後継モデルが開発中であり、ビデオ生成と改善された空間推論に焦点を当てていると発表しました。リリース日は確認されていません。また、同社はMIT CSAILコミュニティからの要請に応じて、非商業研究用にモデルの重みをオープンソース化する計画も立てています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·image-generation·xai·deep-learning
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴