Google a lancé Nano Banana 2.1 le 6 octobre comme modèle d’image largement disponible. Les développeurs disposent désormais d’un identifiant stable, de commandes de sortie et de prix API publiés. Les comparaisons de qualité restent celles de Google.

Les notes de version Gemini API du 6 octobre indiquent la disponibilité générale de Nano Banana 2.1 et nomment gemini-nano-banana-2.1 comme identifiant API stable. L’entreprise le recommande pour les nouveaux projets à la place de Nano Banana 2, gemini-3.1-flash-image, qu’elle a retiré sans annoncer de date d’arrêt. Pour décider d’utiliser le nouveau modèle, le changement concret est un parcours documenté, d’une entrée textuelle ou d’une image de référence à une image 1K, 2K ou 4K, avec un prix publié et des limites explicites.

Le principal changement

Ce qui a changé : Google a lancé Nano Banana 2.1 le 6 octobre 2026 comme modèle de génération d’images et d’édition conversationnelle largement disponible. Sa fiche de modèle indique une base Gemini 3.6 Flash et répertorie l’application Gemini, AI Studio, Gemini API, Search AI Mode, Ads, Flow et Stitch parmi les canaux de distribution.

Comment cela fonctionne pour un lecteur : Dans l’API, le développeur sélectionne gemini-nano-banana-2.1 et fournit du texte et, éventuellement, une image, puis reçoit des sorties image et texte. Le guide de génération d’images documente jusqu’à 14 images de référence, le contrôle de la taille de sortie et du rapport hauteur/largeur, l’ancrage facultatif par la recherche et trois niveaux de réflexion. Un créateur peut aussi essayer le modèle dans Google AI Studio ou un autre produit Google répertorié ; la liste des canaux ne garantit pas que tous les comptes disposent du même accès ou des mêmes commandes.

Pourquoi c’est important : Le prix API payant d’une image de sortie 1K standard est de 0,0336 $, contre 0,067 $ pour Nano Banana 2 sur la page tarifaire de Google. C’est une comparaison de prix pour la sortie API précisée, et non une mesure de qualité ou de latence. BIG CHANGE a consulté la documentation sans exécuter le modèle.

Choisir une interface, puis vérifier le résultat

Pour créer ou modifier une image sans développer d’intégration, un créateur peut utiliser l’application Gemini et Flow, cités dans la fiche du modèle ; la page du modèle pour développeurs renvoie directement à Google AI Studio. Vérifiez la disponibilité et les commandes dans le compte prévu avant d’adopter un flux de travail.

Pour une application, les exemples actuels du guide API utilisent l’ Interactions API avec l’identifiant stable du modèle. Une instruction textuelle peut renvoyer des données d’image ; une demande de modification ajoute des données d’image et une instruction. La page répertorie le texte, les images, la vidéo et les PDF comme entrées acceptées, et les images et le texte comme sorties. L’entrée audio n’est pas prise en charge. La réponse par défaut comprend l’image et le texte, tandis que response_format peut demander uniquement des images ou préciser un rapport hauteur/largeur et une taille. La taille par défaut est 1K ; 2K et 4K sont aussi disponibles. Les limites sont de 131 072 jetons en entrée et 32 768 en sortie. Le tableau ne prend pas en charge la mise en cache, les appels de fonction, les sorties structurées ni Live API.

Les images de référence peuvent aider à modifier et composer. Google indique jusqu’à 14 références par flux, une ressemblance jusqu’à quatre personnages et une fidélité jusqu’à dix objets. Ces chiffres décrivent les entrées et objectifs de conception, sans garantir que chaque sujet reste inchangé. Google propose aussi les niveaux de réflexion minimal , medium et high ; le niveau medium est celui par défaut. Le guide présente l’ancrage Google Web Search et un type Image Search facultatif ; l’application doit configurer l’outil de recherche pour le demander. Google indique que cette méthode ne permet pas d’utiliser des images Web de personnes réelles.

Avant l’adoption, vérifiez l’accès à l’interface dans le compte prévu, utilisez l’identifiant et le type d’entrée documentés, puis examinez l’image obtenue à sa taille d’affichage prévue. BIG CHANGE n’a pas effectué cette génération ; cet article présente la documentation de Google.

Évaluer le coût de la demande

Le tableau des prix de Google ne propose pas de formule API gratuite. Les tarifs standard sont de 1,50 $ par million de jetons d’entrée texte, image ou vidéo ; 7,50 $ par million de jetons de sortie texte et réflexion ; et 30 $ par million de jetons de sortie image. Cela équivaut à 0,0336 $ en 1K, 0,0504 $ en 2K et 0,113 $ en 4K. Les tarifs Batch représentent la moitié des tarifs correspondants, avec des équivalents image de 0,0168 $, 0,0252 $ et 0,0567 $. L’ancrage par la recherche partage un quota mensuel de 5 000 demandes entre les modèles Gemini 3.x, puis coûte 14 $ pour 1 000 demandes. Une demande peut déclencher plusieurs recherches facturées. Vérifiez les tarifs actuels et la facturation avant un déploiement à grand volume.

Les résultats de Google et les limites restantes

Google affirme que la conception visuelle, la modification, le rendu du texte et la cohérence des sujets sont meilleurs que dans les modèles précédents. Dans sa fiche de modèle d’octobre 2026, l’entreprise décrit des évaluations humaines côte à côte et une mesure automatisée unilatérale de factualité, combinant références publiques et ensembles internes. Le score de factualité des infographies est de 0,521 pour Nano Banana 2.1 avec réflexion, contre 0,179 pour Nano Banana 2. Ce sont les résultats de Google selon ses conditions. Le reportage de lancement de Decrypt signalait aussi l’absence de tests indépendants ; il ne vérifie pas les scores.

La fiche mentionne le flou des petits textes, une cohérence imparfaite des personnages, le suivi partiel des consignes lors des modifications masquées, la confusion gauche-droite et des limites en factualité et raisonnement spatial. Elle signale aussi des hallucinations et des demandes parfois lentes ou expirées. Une image fondée sur une recherche doit être vérifiée ; une image de production doit être examinée à sa taille prévue. Selon le guide API, toutes les images comportent le filigrane SynthID de Google.

Une divergence documentaire mérite attention : la fiche décrit une fenêtre de contexte jusqu’à un million de jetons et une sortie textuelle plus grande, tandis que la page du modèle API indique 131 072 jetons en entrée et 32 768 en sortie. La page du modèle est la spécification API explicite utilisée ici. Google devrait harmoniser ces chiffres ; les développeurs devraient consulter la documentation actuelle du point de terminaison et les limites de leur compte.

Sources et lectures complémentaires