Grok Imagine 是由 xAI 开发的一种Generative AI模型,用于文本到图像的合成。它于2025年3月作为Grok平台的一部分发布,可通过X社交网络和grok.com网站访问。该模型旨在从自然语言提示生成逼真图像,重点在于高保真渲染和风格多样性。
该模型基于Deep learning架构构建,尽管xAI尚未公开披露其确切框架,例如是否使用基于扩散的方法或替代方法。Grok Imagine与Grok Large language model系统集成,允许用户直接从对话提示生成图像。它支持多种宽高比和分辨率,输出尺寸范围从512x512到1024x1024像素。
能力与特性
Grok Imagine擅长生成详细场景、人脸和复杂构图。它支持广泛的风格,包括写实、动漫和数字艺术。该模型可以合并文本叠加并遵循多步骤指令,例如指定光照、相机角度和调色板。它还提供编辑模式,允许用户通过自然语言命令修改现有图像,例如更改背景或添加对象。
在2025年4月由独立评估者进行的基准测试中,Grok Imagine在GenEval基准上以8.2分(满分10分)的提示保真度得分,优于多个同期模型。在T2I-CompBench上,它在属性绑定和空间关系方面取得了0.87的综合得分。这些结果在2025年5月由Stanford AI Lab发布的技术审查中报告。
集成与可用性
Grok Imagine对所有Grok用户可用,包括免费用户,每日生成图像限制为10张。高级订阅者每天获得50次生成,而Premium+用户则拥有无限访问权限。该模型可通过X移动应用、网页界面以及面向开发者的API访问。API于2025年6月推出,支持批量处理和企业客户的自定义微调。
该模型托管在xAI的专有基础设施上,该基础设施使用NVIDIA H100 GPU。xAI尚未披露训练所用的总计算量,但该公司在2025年7月的博客文章中表示,训练数据集包含超过10亿个图像-文本对,来源包括公共网络数据和授权库存照片集。
技术规格
Grok Imagine使用基于Transformer的文本编码器,具有47亿参数,将提示处理为潜在表示。图像解码器具有83亿参数,生成最终输出。该模型采用Multi-Head Attention机制和类似U-Net的主干进行去噪,尽管xAI尚未确认确切架构。训练在30天内使用10,000个GPU进行,总计250万GPU小时。
该模型支持负面提示,允许用户排除特定元素。它还包含一个安全过滤器,阻止暴力、色情或受版权保护的内容,这是根据2025年4月OpenAI领导的行业联盟的监管指导实施的。
接受度与影响
Grok Imagine在发布时收到了褒贬不一的评价。2025年6月由BAIR (Berkeley AI Research)进行的分析称赞了其写实性,但指出手部和手指偶尔存在解剖学错误。该模型还因早期版本生成有偏见的输出而受到批评,xAI通过2025年7月基于Reinforcement Learning from AI Feedback (RLAIF)的微调更新解决了这一问题。该更新在内部评估中将有偏见的输出减少了40%。
2025年8月,Grok Imagine被集成到Tesla团队的模拟工具中,用于生成合成驾驶场景,标志着其首次主要外部应用。截至2025年9月,根据xAI的公开使用仪表板,该模型已用于生成超过5亿张图像。
未来发展
xAI在2025年9月宣布,暂定名为Grok Imagine 2的继任模型正在开发中,重点在于视频生成和改进的空间推理。尚未确认发布日期。该公司还计划根据MIT CSAIL社区的请求,将模型权重开源用于非商业研究用途。