Google hat Nano Banana 2.1 am 6. Oktober als allgemein verfügbares Bildmodell veröffentlicht. Entwickler haben nun eine stabile Modell-ID, Ausgabesteuerungen und veröffentlichte API-Preise. Die Qualitätsvergleiche stammen weiterhin aus Googles eigenen Tests.

Laut den Gemini-API-Versionshinweisen vom 6. Oktober ist Nano Banana 2.1 allgemein verfügbar; als stabile API-ID wird gemini-nano-banana-2.1 genannt. Für neue Projekte empfiehlt das Unternehmen das Modell anstelle von Nano Banana 2, gemini-3.1-flash-image, das ohne angekündigtes Abschaltdatum eingestellt wurde. Für die Entscheidung über einen Wechsel ist die praktische Neuerung ein dokumentierter Weg von Text oder Referenzbild zu einem 1K-, 2K- oder 4K-Bild, mit veröffentlichtem Preis und klaren Grenzen.

Die wichtigste Änderung

Was sich geändert hat: Google hat Nano Banana 2.1 am 6. Oktober 2026 als allgemein verfügbares Modell zur Bilderzeugung und dialogbasierten Bearbeitung veröffentlicht. Laut seiner Modellkarte basiert es auf Gemini 3.6 Flash. Als Vertriebskanäle nennt sie die Gemini-App, AI Studio, Gemini API, Search AI Mode, Ads, Flow und Stitch.

So funktioniert es für Leser: In der API wählt ein Entwickler gemini-nano-banana-2.1 aus, übergibt Text und optional ein Bild und erhält Bild- und Textausgaben. Der Leitfaden zur Bilderzeugung dokumentiert bis zu 14 Referenzbilder, Steuerungen für Ausgabegröße und Seitenverhältnis, optionales Search Grounding und drei Denkstufen. Alternativ lässt sich das Modell in Google AI Studio oder einem anderen aufgeführten Google-Produkt ausprobieren. Die Kanalliste belegt nicht, dass jedes Konto denselben Zugriff oder dieselben Steuerungen hat.

Warum das wichtig ist: Der kostenpflichtige API-Preis für ein reguläres 1K-Ausgabebild beträgt 0,0336 US-Dollar, gegenüber 0,067 US-Dollar für Nano Banana 2 auf Googles Preisseite. Das ist ein Preisvergleich für die angegebene API-Ausgabe, kein gemessener Vergleich von Bildqualität oder Latenz. BIG CHANGE hat die Dokumentation geprüft, das Modell aber nicht ausgeführt.

Oberfläche auswählen und Ausgabe prüfen

Wer Bilder ohne eigene Integration erstellen oder überarbeiten möchte, findet die Gemini-App und Flow unter den Kanälen auf Googles Modellkarte; die Entwickler-Modellseite führt direkt zu Google AI Studio. Prüfen Sie Verfügbarkeit und Produktsteuerungen im vorgesehenen Konto, bevor Sie einen Workflow festlegen.

Die aktuellen API-Beispiele für Anwendungen verwenden die Interactions API mit der stabilen Modell-ID. Ein Textprompt kann Bilddaten zurückgeben; eine Bearbeitungsanfrage ergänzt Bilddaten und eine Anweisung. Die Modellseite nennt Text, Bilder, Video und PDF als unterstützte Eingaben sowie Bild und Text als Ausgaben. Audioeingaben werden nicht unterstützt. Laut Leitfaden enthält die Standardantwort Bild und Text; mit response_format lassen sich nur Bilder anfordern oder Seitenverhältnis und Bildgröße festlegen. Standardmäßig ist die Bildgröße 1K; 2K und 4K sind ebenfalls möglich. Die Entwickler-Modellseite nennt 131.072 Eingabe- und 32.768 Ausgabetoken als Grenzen. Caching, Funktionsaufrufe, strukturierte Ausgaben und Live API werden in der Tabelle nicht unterstützt.

Referenzbilder können bei Bearbeitung und Compositing helfen. Laut Google nimmt ein Workflow bis zu 14 Referenzen an, mit Ähnlichkeit für bis zu vier Figuren und Detailtreue für bis zu zehn Objekte. Diese Zahlen beschreiben unterstützte Eingaben und Designziele, garantieren aber nicht, dass jedes Motiv unverändert bleibt. Google bietet außerdem die Denkstufen minimal, medium und high; standardmäßig gilt medium. Der Leitfaden zeigt Google Web Search Grounding und einen optionalen Image-Search-Typ. Eine Anwendung muss das Suchtool dafür konfigurieren. Laut Google unterstützt dieser Bilderzeugungsweg keine echten Personenbilder aus der Websuche.

Prüfen Sie vor der Nutzung, ob das vorgesehene Konto die Oberfläche bereitstellt, verwenden Sie die dokumentierte Modell-ID und Eingabeart und kontrollieren Sie ein erzeugtes Bild in der späteren Anzeigegröße. BIG CHANGE hat diese Generierung nicht ausgeführt; der Artikel fasst Googles Dokumentation zusammen.

Die Kosten der konkreten Anfrage berechnen

Googles Preistabelle sieht für dieses Modell keine kostenlose API-Stufe vor. Die Standardpreise betragen 1,50 US-Dollar je Million Eingabetoken für Text, Bild oder Video, 7,50 US-Dollar je Million Ausgabetoken für Text und Denken sowie 30 US-Dollar je Million Bildausgabetoken. Google setzt diesen Bildpreis mit 0,0336 US-Dollar für 1K, 0,0504 für 2K und 0,113 für 4K gleich. Die Batch-Preise betragen die Hälfte der jeweiligen Tokenpreise; die Bildäquivalente liegen bei 0,0168, 0,0252 und 0,0567 US-Dollar. Für Search Grounding teilen sich Gemini-3.x-Modelle monatlich 5.000 Anfragen; danach kosten 1.000 Anfragen 14 US-Dollar. Laut Google kann eine Nutzeranfrage mehrere kostenpflichtige Suchabfragen auslösen. Prüfen Sie vor einem Einsatz mit hohem Volumen die aktuellen Preise und die Abrechnungseinstellungen des Kontos.

Googles Ergebnisse und verbleibende Grenzen

Google berichtet von Verbesserungen bei visuellem Design, Bearbeitung, Textrendering und Motivkonsistenz gegenüber früheren Modellen. In der Modellkarte vom Oktober 2026 beschreibt das Unternehmen menschliche paarweise Präferenzbewertungen und eine einseitige automatisierte Faktentreuebewertung, die öffentliche Benchmarks mit internen Datensätzen verbindet. In der Infografik erreicht Nano Banana 2.1 mit aktivem Thinking 0,521 und Nano Banana 2 mit Thinking 0,179. Das sind Googles Ergebnisse unter den ausgewählten Bedingungen. Auch der Decrypt-Bericht zur Veröffentlichung verwies auf fehlende unabhängige Tests zum Start; er überprüft die Werte nicht.

Die Modellkarte nennt selbst unscharfe kleine Schrift, unvollständige Figurenkonsistenz, teilweise Befolgung von Anweisungen bei Maskenbearbeitung, Verwechslungen von links und rechts sowie verbleibende Grenzen bei Faktentreue und räumlichem Schlussfolgern. Sie warnt auch vor Halluzinationen und gelegentlich langsamen oder ablaufenden Anfragen. Ein durch Suche gestütztes Bild muss daher weiterhin auf Fakten geprüft und ein Produktionsbild in der vorgesehenen Anzeigegröße kontrolliert werden. Laut API-Leitfaden tragen alle erzeugten Bilder ein SynthID-Wasserzeichen von Google.

Bei der Integration fällt ein Dokumentationswiderspruch auf: Die Modellkarte nennt ein Kontextfenster von bis zu einer Million Token und eine größere Textausgabe, während die API-Modellseite 131.072 Eingabe- und 32.768 Ausgabetoken aufführt. Oben wurde die ausdrücklich für die API bestimmte Spezifikation der Modellseite verwendet. Google sollte die Zahlen abgleichen; Entwickler sollten beim Bemessen von Anfragen die aktuelle Endpunktdokumentation und Kontogrenzen beachten.

Quellen und weiterführende Informationen