Le 6 octobre, Google a lancé Nano Banana 2.1, la nouvelle version du modèle d’images derrière l’application Gemini. Selon Google, il « surpasse nos modèles précédents sur toute la ligne, avec des bonds notables en conception visuelle, en édition par masque et en constance des sujets » (traduction libre). Pour les développeurs, la grosse nouvelle est le prix : une image standard 1K coûte maintenant la moitié de ce qu’elle coûtait avec Nano Banana 2.

Pour un studio de vidéo IA, le modèle d’images est le premier maillon de la chaîne. Les fiches de personnages, les plans de décors, les images de scénarimage et les photos de produit sont d’abord générés en images, puis animés. Un modèle d’images moins cher et plus constant change le coût et la fiabilité de tout ce qui suit. Voici ce qui est sorti, ce que disent les votes indépendants, et où il accroche encore.

REC ÉDITER UNE ZONE, GARDER LE RESTE MASQUE 2 PERSONNAGES CONSTANTS NANO BANANA 2 · 1K · 0,067 $ NANO BANANA 2.1 · 1K · 0,0336 $
Prix par image standard (1K) de l’API Gemini. L’édition par masque change une zone choisie et laisse le reste de l’image intact.

Ce que Google a lancé

Dans l’API Gemini, le modèle s’appelle gemini-nano-banana-2.1. La fiche du modèle de Google le place dans l’application Gemini, le mode IA de la recherche, Google Ads, Google AI Studio, l’API Gemini, Flow et Stitch. La documentation pour les développeurs énumère les principales capacités : sortie en 1K, 2K ou 4K, jusqu’à 14 images de référence par requête, ancrage dans la recherche Web et la recherche d’images de Google, vidéo en entrée pour produire une image fixe, et trois niveaux de réflexion (minimal, moyen et élevé, alors que Nano Banana 2 n’en avait que deux). Chaque image produite porte un filigrane SynthID.

Ce sont les changements en édition qui comptent le plus en production. L’édition par masque permet de délimiter une zone de l’image et de ne modifier que celle-là. La constance des sujets veut dire qu’un même personnage ou un même produit doit garder la même apparence d’une retouche à l’autre. Les deux s’attaquent à la raison la plus courante de jeter une image IA : un seul détail raté dans une image autrement réussie.

Le prix, et le piège du côté de l’entrée

La page des prix de Google indique 0,0336 $ US par image 1K, contre 0,067 $ pour Nano Banana 2. Une image 2K passe de 0,101 $ à 0,0504 $, et une image 4K de 0,151 $ à 0,113 $. Le traitement par lots, pour les travaux qui peuvent attendre, coûte encore la moitié : 0,0168 $ par image 1K.

Deux fois moins cher en 1K et 2K, un quart de moins en 4K

Prix standard par image de l’API Gemini, en dollars américains

Nano Banana 2Nano Banana 2.1Image 1KImage 1K, Nano Banana 2 : 0,067 $0,067 $Image 1K, Nano Banana 2.1 : 0,0336 $0,0336 $Image 2KImage 2K, Nano Banana 2 : 0,101 $0,101 $Image 2K, Nano Banana 2.1 : 0,0504 $0,0504 $Image 4KImage 4K, Nano Banana 2 : 0,151 $0,151 $Image 4K, Nano Banana 2.1 : 0,113 $0,113 $
Prix standard par image, API Gemini, en dollars américains
RésolutionNano Banana 2Nano Banana 2.1
Image 1K0,067 $0,0336 $
Image 2K0,101 $0,0504 $
Image 4K0,151 $0,113 $
Source : Google, page des prix de l’API Gemini, consultée le 7 octobre 2026. Le traitement par lots coûte la moitié de ces prix.

L’entrée, elle, va dans l’autre sens. Le texte, les images et la vidéo envoyés au modèle coûtent maintenant 1,50 $ par million de jetons, contre 0,50 $ avec Nano Banana 2. La plupart des requêtes simples sont petites, donc l’économie en sortie l’emporte. Un flux de travail qui envoie beaucoup de grosses images de référence à chaque requête devrait vérifier ses propres factures : plus il y a de références par appel, plus le prix d’entrée pèse.

Un cas concret : un scénarimage de 40 images en 2K, chacune générée trois fois avant d’en garder une, donne 120 images. C’est environ 12 $ avec Nano Banana 2 et 6 $ avec Nano Banana 2.1, sans compter l’entrée. De petits montants par projet, mais ils décident du nombre de variantes qu’une équipe peut se permettre de regarder.

Les scores de Google face aux votes à l’aveugle

La fiche du modèle de Google donne un score global de préférence en génération d’images de 1050 (±14), une cote de type Elo tirée de comparaisons humaines. Decrypt rapporte les points de comparaison de Google : 990 pour Nano Banana 2 et 935 pour Nano Banana Pro. Le gain le plus marqué de la fiche est la constance de plusieurs personnages en édition, à 1106. Pour l’exactitude des infographies, Google annonce 0,521, contre 0,179 pour le modèle précédent selon Decrypt.

Ce sont les tests de Google. La première vérification externe vient d’Arena, où des utilisateurs votent entre deux images anonymes. Le 6 octobre, son classement en génération d’images plaçait Nano Banana 2.1 en cinquième place, à 1328 (±9) sur 5 312 votes, une cote préliminaire. Les quatre modèles devant lui : deux variantes de GPT Image 2.5, GPT Image 2 et MAI-Image-2.6 de Microsoft. Au classement de l’édition d’images, il était sixième à 1428, à égalité avec MAI-Image-2.6, le premier modèle d’OpenAI étant à 1524.

Les deux résultats ne se contredisent pas. Nano Banana 2.1 est nettement meilleur que les modèles précédents de Google, et nettement pas le meilleur modèle d’images sur le marché. Pour un acheteur, la bonne lecture : c’est maintenant une option solide à prix moyen, pas la réponse par défaut à tous les mandats.

Ce que Google reconnaît qu’il rate encore

La fiche du modèle est franche. Le petit texte est souvent flou. La constance d’un personnage entre l’image d’entrée et le résultat n’est pas parfaite. Les retouches guidées par des croquis ne suivent les consignes qu’en partie. Les connaissances générales et le raisonnement 3D sont limités, et les connaissances s’arrêtent en mars 2026. Concrètement, une étiquette de produit, un écran de téléphone ou une affiche à l’arrière-plan doivent encore être vérifiés en pleine grandeur, et une fiche de personnage a encore besoin d’un œil humain avant d’alimenter un modèle vidéo.

Ce que ça change pour la production vidéo IA

Les fiches de référence coûtent moins cher à itérer. Quand un personnage, un accessoire ou un décor doit rester identique tout au long d’un film, l’essentiel du travail se fait avant l’animation : générer des fiches propres, les comparer, corriger les détails. Couper de moitié le prix de cette étape paie plus de variantes et un meilleur choix final.

Les corrections rapetissent. Avec l’édition par masque, une veste de la mauvaise couleur ou un logo mal placé se corrige sur place, au lieu de régénérer une image dont la composition était déjà approuvée. Pour une révision avec un client, c’est la différence entre une retouche et une nouvelle ronde.

Les scènes à plusieurs personnages deviennent plus faisables. Le score de constance de plusieurs personnages est le meilleur chiffre de Google, et deux ou trois personnes dans la même image, c’est justement là que les modèles d’images dérivaient. Il faut quand même le tester sur vos propres personnages, puisque la fiche elle-même dit que la constance n’est pas parfaite.

L’imprimé et les grands formats deviennent une option. La sortie 4K à 0,113 $ rend possibles les affiches, les visuels clés et les maquettes d’affichage extérieur à partir de la même chaîne, à condition de vérifier le texte fin ou de le poser à la main.

La divulgation est intégrée. Chaque image porte SynthID. Ça convient aux clients qui veulent que le travail IA soit identifié, et ça vaut la peine de le dire d’entrée de jeu aux clients qui ne s’y attendent pas. Notre page IA responsable explique comment on s’y prend.

Avant de changer

Faites passer vingt de vos vrais briefs dans les deux versions et demandez à la personne qui approuve habituellement les images de choisir à l’aveugle. Comptez le coût par image approuvée, reprises comprises, plutôt que le prix par image. Si vos requêtes contiennent beaucoup de références, vérifiez le coût d’entrée sur une vraie facture. Rien ne presse : au 7 octobre, la page des retraits de modèles de Google n’indique aucune date de fin pour Nano Banana 2, même si certains médias ont parlé d’un arrêt le 29 octobre. C’est le Nano Banana original qui a une date, le 15 mars 2027.

Sources

Gabriel Brien

Gabriel Brien

Fondateur de l’Agence Crimson Spark. Réalisateur IA et technologue créatif, qui écrit à partir de ce qu’il pratique chaque jour.

En savoir plus sur Gabriel →