Google lance Nano Banana 2 : le nouveau roi de l'imagerie IA ?

Google lance Nano Banana 2 : le nouveau roi de l'imagerie IA ?

En résumé

  • Google a lancé Nano Banana 2, son nouveau modèle d'imagerie basé sur Gemini 3.1 Flash, avec recherche sur le Web en temps réel, rendu de texte précis et sortie jusqu'à 4K.
  • Le modèle remplace Nano Banana Pro comme option par défaut dans l'application Gemini et est disponible dans Search, Lens, AI Studio et Vertex AI sans frais de crédit dans Flow.
  • ByteDance a lancé Seedream 5 la même semaine avec des fonctionnalités similaires, une modération plus permissive et un prix de 0,035 $ par image, soit un tiers du coût de Google.

Google a récemment publié des logiciels d'IA à un rythme effréné. Rien que la semaine dernière, nous avons vu Gemini 3.1, Lyria et Pali, qui sont arrivés avec une fonction de séance photo qui s'est avérée être un véritable succès auprès des utilisateurs. Et maintenant, la suite de ce qui pourrait être considéré comme le plus gros succès d'imagerie de l'année dernière est arrivée.

Nano Banana 2, sorti jeudi, « apporte l'intelligence à grande vitesse de Gemini Flash à la génération visuelle, rendant possible des modifications et des itérations rapides », a déclaré Google dans un article de blog officiel, ajoutant qu'il « met les fonctionnalités exclusives Pro à la portée d'un public plus large ».

Un bref résumé : le Nano Banana original s'appelait en fait Gemini 2.5 Flash Image, et il s'agissait essentiellement de cela : un imageur basé sur Gemini 2.5 Flash. Puis est venu Nano Banana Pro, qui était Gemini 3 Pro Image, et il est devenu la référence en matière d'édition d'images IA lors de son lancement en novembre dernier.

Techniquement, Nano Banana 2 est une image Flash Gemini 3.1, ce n'est donc pas une suite directe de Pro, mais plutôt une version considérablement améliorée de l'original, fonctionnant désormais sur le nouveau noyau Gemini 3 Flash. Confus? Ouais.

La proposition est simple : prendre tout ce qui rend Nano Banana Pro spécial et le faire fonctionner à la vitesse Flash.

Le nouveau Nano Banana 2 est aujourd'hui déployé dans l'écosystème Google. Dans l'application Gemini, il remplace Nano Banana Pro comme modèle par défaut sur les modèles Fast, Thinking et Pro. Les abonnés Google AI Pro et Ultra peuvent toujours accéder à Nano Banana Pro pour des tâches spécialisées en régénérant via le menu à trois points.

Il est également disponible en mode Google Search AI et dans Lens, accessible via l'API Gemini dans AI Studio et dans Vertex AI en avant-première, et constitue le nouveau modèle d'imagerie par défaut dans Flow sans frais de crédit pour tous les utilisateurs. Google étend également le filigrane SynthID et ajoute la prise en charge des informations d'identification de contenu C2PA afin de fournir aux plateformes de meilleurs outils pour identifier le contenu généré par l'IA. La fonctionnalité de vérification SynthID a déjà été utilisée plus de 20 millions de fois depuis novembre.

Quoi de neuf dans Nano Banana 2 ?

Le titre le plus important est la connaissance du monde. Nano Banana 2 peut accéder aux recherches Web en temps réel pendant l'imagerie, ce qui signifie qu'il peut restituer avec précision des sujets spécifiques. Logos, monuments, événements récents, identités de marque : vous savez à quoi ressemblent les choses car vous pouvez les rechercher, pas seulement les deviner à partir des données d'entraînement.

Le rendu du texte a également reçu une amélioration majeure. Il est désormais possible de générer un texte précis et lisible dans les images, soit en le tapant à l'invite, soit en laissant le modèle décider quoi écrire en fonction du contexte. Il gère également la traduction au sein de l'image, de sorte qu'une campagne publicitaire peut être localisée dans plusieurs langues sans reconstruire le visuel à partir de zéro.

La cohérence des sujets évolue également vers de nouveaux terrains. Le modèle peut conserver la ressemblance des personnages sur jusqu'à cinq sujets et préserver la fidélité visuelle sur jusqu'à 14 objets dans un seul flux de travail, selon Google. C’est très pertinent pour ceux qui développent des récits, des storyboards ou des actifs de marque cohérents.

En termes de production, vous obtenez de 512 pixels jusqu'à 4K, avec une prise en charge native d'une grande variété de formats d'image. Le suivi des instructions est également plus précis que dans les modèles Flash précédents, ce qui signifie en pratique moins d'invites faisant approximativement ce qui a été demandé et plus d'invites faisant exactement ce qui a été demandé.

Le raisonnement est également désormais configurable. Les développeurs peuvent définir des niveaux de réflexion de Minimal (valeur par défaut) à Élevé ou Dynamique, permettant au modèle de raisonner à travers des invites complexes avant de s'engager dans un rendu. Cette combinaison de rapidité et de délibération facultative est à l’origine d’une grande partie des améliorations de la qualité.

Tester le modèle

Les allégations de vitesse sont réelles. Nous avons demandé à Nano Banana 2 de générer une chronologie complète de l'écosystème Bitcoin, y compris la recherche et l'art final. L’ensemble du processus a pris à peu près le même temps que celui nécessaire à Nano Banana Pro pour terminer la chronologie Bitcoin. Lorsque nous l’avons suivi d’une invite sur la chronologie Ethereum, il n’a pratiquement pas enregistré de temps supplémentaire. C'est une différence significative pour ceux qui gèrent des pipelines itératifs ou qui construisent à grande échelle.

La capacité de connaissance du monde change vraiment la façon dont le résultat est ressenti. Lorsque nous avons demandé une chronologie historique des crypto-monnaies, le modèle a recherché plusieurs sources, sélectionné les événements les plus pertinents et structuré l'art autour d'eux. Ce n'était pas générique. Le modèle a pris des décisions éditoriales. Le seul vrai bug que nous avons trouvé était un lien visuel manquant entre la fin d’une section et le début de la suivante. Tout le reste tient. Nano Banana Pro, en comparaison, a produit quelque chose de plus génériquement artistique et n'a fait aucun effort apparent pour rechercher ou hiérarchiser les événements.

Par exemple, c'est ce que Nano Banana 2 a généré lorsqu'on lui a demandé de « Créer une chronologie de l'histoire de Bitcoin, mettant en évidence les événements les plus importants depuis sa création jusqu'à aujourd'hui. Grand écran, style de dessin pour enfants » en utilisant la réflexion.

En revanche, il s'agit de la même génération utilisant Nano Banana Pro :

La cohérence des caractères et la gestion du texte ont été les éléments les plus impressionnants de nos résultats de tests. Nous avons demandé au modèle de générer une couverture de magazine, et chaque ligne de texte est ressortie précise et bien définie. Pas de caractères déroutants et pas de typographie parasite.

Nano Banana Pro est également solide à cet égard, mais produit plus d'erreurs, et le résultat de sa couverture de magazine avait une qualité de rendu 3D qui lui donne un aspect synthétique.

Le résultat de Nano Banana 2 semble photoréaliste. Il affiche également moins de caractères tronqués lors de la génération de texte par son propre raisonnement, et pas seulement lorsqu'il est explicitement indiqué quoi taper.

Cela dit, le modèle a une limite de contenu claire. Nous avons demandé à Nano Banana 2 de retoucher une vraie photo et de changer la tenue en sous-vêtements. Après un long cycle de raisonnement, il a refusé. Il fallait s'y attendre, si ce n'était du fait qu'il refusait de générer le retouche sur une photo de femme, mais pas sur celle d'un homme.

Demander un changement de maillot de bain a fonctionné sans problème. Le niveau de censure semble à peu près équivalent à celui de Nano Banana Pro, ce qui signifie que tout ce qui pousse en territoire explicite ou la manipulation de personnes réelles dans des contextes suggestifs sera bloqué. Cela compte plus qu’il n’y paraît, et nous expliquerons pourquoi dans un instant.

Seedream 5 : Nano Banana 2 a de la concurrence

Ce qui est amusant dans le lancement d'un modèle d'imagerie phare fin février 2026, c'est que ByteDance a lancé Seedream 5 la même semaine.

Seedream est devenu un favori de la communauté au cours de la dernière année, et pour cause. Il est flexible, rentable – environ 0,035 $ par image via l'API, soit environ un tiers des prix de Google – et sa modération de contenu est considérablement plus permissive que celle de Google. Ce dernier point lui a valu une base de fans fidèles parmi les créateurs qui ont besoin de plus de latitude pour travailler avec de vraies personnes ou repousser les limites visuelles.

Seedream 5 intègre une recherche Web en temps réel dans son pipeline de génération, un raisonnement amélioré, une plus grande cohérence des références et la prise en charge de jusqu'à 14 images de référence dans un seul flux d'édition à plusieurs tours. Générez en 2K et 4K en quelques secondes. Il peut également s'exécuter localement, ce que Google ne permet pas, et est disponible sur CapCut et Jianying de ByteDance, ainsi que via l'API standard.

En bref, Google et ByteDance ont lancé la même semaine des modèles d'images avec recherche Web intégrée et raisonnement amélioré. Cela en dit long sur la direction que prend l’ensemble de la catégorie.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.



Voir l’article original en espagnol