Nano Banana est un surnom largement partagé pour la capacité de génération d'images du grand modèle de langage Gemini de Google, introduit fin 2024. Cette fonctionnalité, qui fait partie de la famille de modèles multimodaux Gemini développée par Google DeepMind, permet aux utilisateurs de générer et de modifier des images à l'aide de prompts en langage naturel. Elle a attiré l'attention virale sur les réseaux sociaux pour sa capacité à produire des images humoristiques, surréalistes et hautement personnalisables, présentant souvent un motif de banane, devenu un mème. Le nom « Nano Banana » est une référence ludique à la variante de modèle Gemini Nano, conçue pour les tâches sur appareil, bien que la fonctionnalité de génération d'images elle-même s'exécute sur des versions cloud plus puissantes de Gemini.
La fonctionnalité a été déployée dans le cadre d'une mise à jour plus large du chatbot et de l'API Gemini, suite à la sortie de Gemini 2.0 Flash Experimental en décembre 2024. Elle s'appuyait sur les avancées en IA générative et en grands modèles de langage pour combiner la compréhension du texte avec la synthèse d'images, permettant aux utilisateurs de créer des images avec des personnages et des styles cohérents sur plusieurs tours de conversation. Cette capacité a été perçue comme une réponse directe à des fonctionnalités similaires de concurrents comme OpenAI avec DALL-E et Anthropic avec Claude, et elle a souligné la volonté de Google d'intégrer l'IA dans tout son écosystème.
Contexte et développement
Le projet Gemini de Google a commencé comme successeur de modèles antérieurs comme LaMDA et PaLM 2, avec un développement annoncé à Google I/O le 10 mai 2023. L'objectif était de créer un modèle nativement multimodal capable de traiter simultanément le texte, les images, l'audio, la vidéo et le code. Le projet était dirigé par Google DeepMind, une fusion de Google Brain et DeepMind, et impliquait la contribution de centaines d'ingénieurs, y compris le cofondateur Sergey Brin, rappelé de sa retraite.
En août 2023, des rapports indiquaient que Google prévoyait d'intégrer des capacités de génération d'images dans Gemini, visant à surpasser ses concurrents en offrant une création d'images contextuelle. Cette vision s'est concrétisée avec le lancement de Gemini 1.0 le 6 décembre 2023, qui comprenait trois variantes : Ultra, Pro et Nano. Alors qu'Ultra et Pro étaient conçus pour des tâches cloud, Nano était optimisé pour le traitement sur appareil, comme sur les smartphones. La fonctionnalité de génération d'images, cependant, ne faisait pas partie de la version initiale et a été introduite plus tard dans le cadre de mises à jour itératives.
Le développement de la génération d'images dans Gemini s'est appuyé sur des travaux antérieurs en réseaux neuronaux et en apprentissage profond, en particulier dans des domaines comme les réseaux résiduels et les architectures U-Net, courantes dans les modèles de synthèse d'images. Google a également exploité son matériel TPU personnalisé pour entraîner et exécuter ces modèles efficacement.
Émergence virale
Le phénomène « Nano Banana » a émergé fin 2024, peu après que Google a étendu les capacités de génération d'images de Gemini à un public plus large. Les utilisateurs ont découvert que le modèle pouvait générer des images avec un style distinctif, souvent absurdement humoristique, et ils ont commencé à partager des créations mettant en scène des bananes dans divers contextes - par exemple, une banane assise sur un trône, une banane en super-héros, ou une banane dans des scènes historiques. Le mème s'est répandu rapidement sur des plateformes comme X (anciennement Twitter), Instagram et TikTok, avec le hashtag #NanoBanana en tendance.
Le nom « Nano Banana » a été inventé par les utilisateurs comme un clin d'œil ludique à la variante Gemini Nano, bien que la fonctionnalité soit en réalité alimentée par des modèles plus grands. La nature virale du mème a été alimentée par la capacité du modèle à maintenir la cohérence des personnages à travers plusieurs modifications, permettant aux utilisateurs de créer des récits élaborés avec un seul personnage de banane. Cette capacité représentait une amélioration significative par rapport aux modèles de génération d'images antérieurs, qui avaient souvent du mal avec la cohérence.
Aspects techniques
D'un point de vue technique, Nano Banana exploite les capacités multimodales de Gemini, qui est entraîné sur un mélange de texte, d'images, d'audio et de vidéo. Le processus de génération d'images implique probablement une combinaison d'architectures transformeur, d'attention multi-têtes et de mécanismes de attention croisée pour aligner les prompts textuels avec les sorties visuelles. Le modèle utilise des techniques telles que l'échantillonnage top-p et la mise à l'échelle de température pour contrôler le caractère aléatoire et la diversité des images générées.
Une caractéristique clé est la capacité de modifier des images via des prompts conversationnels, comme « change le fond en plage » ou « mets un chapeau à la banane ». Cela est réalisé grâce à un processus itératif où le modèle affine l'image en fonction des retours de l'utilisateur, similaire à RLHF (apprentissage par renforcement à partir de retours humains) mais adapté aux tâches visuelles. Le modèle intègre également des techniques d'augmentation de données et de dropout pour améliorer la robustesse et la généralisation.
L'infrastructure de Google, y compris Google Cloud et Vertex AI, prend en charge le déploiement de ces modèles, permettant aux développeurs d'intégrer la génération d'images dans leurs applications. La fonctionnalité est disponible via l'API Gemini, qui offre des points de terminaison synchrones et asynchrones pour la génération d'images.
Impact et réception
Nano Banana a été largement salué pour sa créativité et sa facilité d'utilisation, de nombreux utilisateurs le décrivant comme « amusant » et « addictif ». Il a également été perçu comme une démonstration des progrès de Google en IA générative, positionnant l'entreprise comme un concurrent sérieux d'OpenAI et d'Anthropic. Cependant, certains critiques ont soulevé des inquiétudes concernant le potentiel de mauvaise utilisation, comme la génération d'images trompeuses ou nuisibles, et l'impact environnemental de l'exécution de modèles de génération d'images à grande échelle.
Le succès viral de Nano Banana a également eu un impact culturel, engendrant d'innombrables mèmes, fan arts et même des produits dérivés. Il est devenu une étude de cas sur la manière dont l'IA peut stimuler l'engagement des utilisateurs et la visibilité de la marque, et il a souligné l'importance de fonctionnalités ludiques et accessibles pour attirer les publics grand public.
Comparaison avec les concurrents
Nano Banana a souvent été comparé aux fonctionnalités de génération d'images d'autres entreprises d'IA. OpenAI avec DALL-E 3, intégré à ChatGPT, offrait des capacités similaires mais était critiqué pour être plus restrictif en termes de modération de contenu. Anthropic avec Claude, bien que fort en génération de texte, n'offrait pas initialement de génération d'images. L'avantage de Google résidait dans son intégration profonde avec son écosystème, comme Google Cloud et Android, et sa capacité à exploiter les retours des utilisateurs de sa base d'utilisateurs massive.
En termes de performance technique, Nano Banana a été remarqué pour sa capacité à générer des images haute résolution avec des détails fins, bien qu'il ait parfois du mal avec des scènes complexes ou le rendu de texte. La vitesse du modèle était également un facteur, la plupart des images étant générées en moins d'une seconde, grâce à l'infrastructure TPU optimisée de Google.
Développements futurs
Suite au succès viral, Google a continué à affiner les capacités de génération d'images de Gemini. Au début de 2025, l'entreprise a publié des mises à jour qui ont amélioré la capacité du modèle à suivre des instructions complexes et réduit les cas de sorties biaisées ou inappropriées. Il y avait également des plans pour intégrer la fonctionnalité dans davantage de produits Google, comme Google Workspace et Google Ads, permettant aux utilisateurs de créer des visuels personnalisés pour des présentations et des campagnes marketing.
À la mi-2025, Nano Banana reste une fonctionnalité populaire, et Google a indiqué qu'il continuerait à investir dans la recherche en IA multimodale. L'entreprise explore des moyens de rendre le modèle plus efficace, potentiellement en utilisant des techniques comme l'élagage de modèle et la quantification pour réduire les coûts de calcul. De plus, des travaux sont en cours pour permettre la génération d'images en temps réel pour la vidéo, ce qui pourrait ouvrir de nouvelles possibilités pour la création de contenu.
Conclusion
Nano Banana est un témoignage de l'avancement rapide de l'intelligence artificielle et de son influence croissante sur la culture populaire. Ce qui a commencé comme une fonctionnalité originale dans un grand modèle de langage est devenu un phénomène mondial, démontrant le pouvoir de l'IA à inspirer la créativité et à connecter les gens. Alors que Google continue de développer sa famille Gemini, il est probable que des moments viraux similaires émergeront, brouillant davantage les frontières entre la créativité humaine et machine.