FLUX是一个文本到图像扩散模型家族,于2024年8月由Black Forest Labs发布,该公司由先前创建Stable Diffusion及相关潜在扩散研究(包括Robin Rombach)的研究人员创立。Black Forest Labs成立于2024年,其创始人在离开Stability AI后组建了公司,而FLUX是该公司的首个重大公开发布。
模型变体
FLUX发布了多个变体,以满足不同的使用场景和许可需求:FLUX.1 [pro],一个封闭的、性能更高的模型,通过API访问;FLUX.1 [dev],一个开放权重的模型,可用于非商业用途和研究;以及FLUX.1 [schnell],一个蒸馏的、更快的开放权重模型,在宽松的Apache 2.0许可下发布,适合商业使用。这种分层结构使Black Forest Labs既能提供完全开放、可商业使用的选项,也能提供质量更高的受限选项,在Midjourney的完全封闭方法与Stable Diffusion最初完全开放发布之间走了一条中间路线。
技术方法
FLUX采用扩散变换器架构,结合了流匹配训练技术,该技术在当代研究中显示出比早期去噪扩散方法更高的效率优势,并且相对于早期的开放扩散模型,模型规模大幅扩大。发布时,FLUX模型被广泛报道在提示遵循、图像细节和图像内文本渲染(历史上一直是基于扩散的图像生成器的弱点)等指标上优于现有的开放替代方案,包括各种版本的Stable Diffusion。
采用与集成
由于FLUX的开放权重变体可以独立下载和运行,该模型迅速被围绕Stable Diffusion成长起来的社区生态系统所采用,包括支持LoRA微调和ControlNet式条件控制工具,并成为Hugging Face和社区微调中心等平台上的常见基础模型。FLUX还获得了一项重要的商业合作,当xAI将FLUX集成为其Grok聊天机器人的图像生成后端时,该模型获得了超越其开源开发者社区的大规模消费者部署。
反响
FLUX被评论者和开源AI社区广泛认为在发布时树立了开放或公开许可图像生成模型的新技术水平,大大缩小了此前开放模型与领先封闭系统(如DALL-E和Midjourney)之间的差距。其发布展示了生成式AI中一种更广泛的模式,即专业团队(通常由曾在某家公司构建第一代突破性模型的研究人员组成)离开后创立专注的初创公司,构建同一技术的下一代,这与OpenAI及其他前沿实验室的人员离职动态相呼应。Black Forest Labs将FLUX的持续开放发布定位为其身份和商业战略的核心,旨在维持图像生成的开放生态系统,即使更广泛的生成式AI行业(包括Google的Veo视频生成工作)正趋向于封闭的、仅限API的产品。