Nano Banana 是谷歌 Gemini 大型语言模型图像生成功能的广为人知的昵称,该功能于 2024 年底推出。作为 Google DeepMind 开发的 Gemini 多模态模型家族的一部分,该功能允许用户通过自然语言提示生成和编辑图像。它在社交媒体上因其能够生成幽默、超现实且高度可定制的图像而迅速走红,这些图像通常以香蕉为主题,并成为了一种网络迷因。“Nano Banana”这个名字是对 Gemini Nano 模型变体的戏谑性引用,该变体专为设备端任务设计,尽管图像生成功能本身运行在更强大的云端版 Gemini 上。
该功能是 Gemini 聊天机器人和 API 更广泛更新的一部分,紧随 2024 年 12 月 Gemini 2.0 Flash Experimental 的发布。它利用了 生成式 AI 和 大型语言模型 的进步,将文本理解与图像合成相结合,使用户能够在多轮对话中创建具有一致角色和风格的图像。这一能力被视为对 OpenAI 的 DALL-E 和 Anthropic 的 Claude 等竞争对手类似功能的直接回应,并凸显了谷歌推动 AI 在其生态系统中整合的决心。
背景与发展
谷歌的 Gemini 项目始于对 LaMDA 和 PaLM 2 等早期模型的继承,其开发于 2023 年 5 月 10 日在 Google I/O 大会上宣布。目标是创建一个原生多模态模型,能够同时处理文本、图像、音频、视频和代码。该项目由 Google DeepMind 领导,这是 Google Brain 和 DeepMind 的合并,并涉及数百名工程师的贡献,包括被召回退休状态的联合创始人 Sergey Brin。
2023 年 8 月,有报道称谷歌计划将图像生成功能整合到 Gemini 中,旨在通过提供情境化图像创建来超越竞争对手。这一愿景在 2023 年 12 月 6 日 Gemini 1.0 的发布中得以实现,该版本包括三个变体:Ultra、Pro 和 Nano。Ultra 和 Pro 专为云端任务设计,而 Nano 则针对智能手机等设备端处理进行了优化。然而,图像生成功能并未包含在初始版本中,而是在后续迭代更新中引入。
Gemini 中图像生成的发展建立在 神经网络 和 深度学习 的先前工作之上,特别是在 残差网络 和 U-Net 架构等领域,这些在图像合成模型中很常见。谷歌还利用其定制 TPU 硬件来高效训练和运行这些模型。
病毒式传播
“Nano Banana”现象于 2024 年底出现,不久后谷歌将 Gemini 的图像生成能力扩展到了更广泛的受众。用户发现该模型能够生成具有独特、常常荒诞幽默风格的图像,并开始分享以香蕉为主题的各种创作,例如,坐在宝座上的香蕉、作为超级英雄的香蕉,或出现在历史场景中的香蕉。这一迷因在 X(原 Twitter)、Instagram 和 TikTok 等平台上迅速传播,#NanoBanana 标签成为热门趋势。
“Nano Banana”这个名字是用户对 Gemini Nano 变体的戏谑性致敬,尽管该功能实际上由更大的模型驱动。这一迷因的病毒式传播得益于模型在多次编辑中保持角色一致性的能力,使用户能够用单个香蕉角色创建复杂的叙事。这一能力相比早期图像生成模型有了显著改进,后者常常在连贯性方面存在困难。
技术方面
从技术角度来看,Nano Banana 利用了 Gemini 的多模态能力,该模型在文本、图像、音频和视频的混合数据上进行训练。图像生成过程可能涉及 Transformer 架构、多头注意力 和 交叉注意力 机制的组合,以将文本提示与视觉输出对齐。模型使用 top-p 采样 和 温度缩放 等技术来控制生成图像的随机性和多样性。
一个关键特性是通过对话式提示编辑图像的能力,例如“将背景改为海滩”或“让香蕉戴上帽子”。这是通过迭代过程实现的,模型根据用户反馈细化图像,类似于 RLHF(基于人类反馈的强化学习),但针对视觉任务进行了调整。模型还结合了 数据增强 和 dropout 技术以提高鲁棒性和泛化能力。
谷歌的基础设施,包括 Google Cloud 和 Vertex AI,支持这些模型的部署,允许开发者将图像生成集成到他们的应用程序中。该功能通过 Gemini API 提供,该 API 提供同步和异步端点用于图像生成。
影响与反响
Nano Banana 因其创造力和易用性而广受赞誉,许多用户将其描述为“有趣”和“令人上瘾”。它也被视为谷歌在 生成式 AI 领域进展的展示,使公司成为 OpenAI 和 Anthropic 的强大竞争对手。然而,一些批评者提出了对潜在滥用的担忧,例如生成误导性或有害图像,以及运行大规模图像生成模型对环境的影响。
Nano Banana 的病毒式成功也产生了文化影响,催生了无数迷因、粉丝艺术甚至周边商品。它成为 AI 如何推动用户参与和品牌知名度的案例研究,并凸显了在吸引主流受众方面,有趣且易访问的功能的重要性。
与竞争对手的比较
Nano Banana 经常与其他 AI 公司的图像生成功能进行比较。OpenAI 的 DALL-E 3 集成在 ChatGPT 中,提供了类似的能力,但因内容审核更为严格而受到批评。Anthropic 的 Claude 虽然在文本生成方面强大,但最初并未提供图像生成。谷歌的优势在于其与生态系统的深度整合,例如 Google Cloud 和 Android,以及利用其庞大用户群反馈的能力。
在技术性能方面,Nano Banana 以其生成具有精细细节的高分辨率图像的能力而著称,尽管它在复杂场景或文本渲染方面有时会遇到困难。模型的速度也是一个因素,得益于谷歌优化的 TPU 基础设施,大多数图像在不到一秒内生成。
未来发展
在病毒式成功之后,谷歌继续完善 Gemini 的图像生成能力。2025 年初,公司发布了更新,改进了模型遵循复杂指令的能力,并减少了偏见或不适当输出的情况。还有计划将该功能整合到更多谷歌产品中,例如 Google Workspace 和 Google Ads,允许用户为演示文稿和营销活动创建自定义视觉内容。
截至 2025 年年中,Nano Banana 仍然是一个受欢迎的功能,谷歌表示将继续投资于多模态 AI 研究。公司正在探索使模型更高效的方法,可能使用 模型剪枝 和 量化 等技术来降低计算成本。此外,正在开展实时图像生成用于视频的工作,这可能为内容创作开辟新的可能性。
结论
Nano Banana 证明了 人工智能 的快速进步及其对流行文化日益增长的影响。最初作为 大型语言模型 中的一个奇特功能,变成了全球现象,展示了 AI 激发创造力和连接人们的力量。随着谷歌继续开发其 Gemini 家族,类似的病毒式时刻很可能会出现,进一步模糊人类与机器创造力之间的界限。