Google 于 10 月 6 日发布 Nano Banana 2.1,这款图像模型现已全面开放。开发者现在有稳定的模型 ID、输出控制项和已公布的 API 价格。质量对比仍是 Google 自行测试的结果。

Google 的10 月 6 日 Gemini API 发行说明将 Nano Banana 2.1 标为全面开放,并列出其稳定的 API IDgemini-nano-banana-2.1。公司建议新项目使用它取代 Nano Banana 2,gemini-3.1-flash-image该旧模型已被弃用,但公司没有公布停用日期。对考虑是否采用新模型的人而言,实际变化是有文档说明的流程:从文本或参考图像输入生成 1K、2K 或 4K 图像,并有公开价格和明确限制。

主要变化

有哪些变化: Google 于 2026 年 10 月 6 日发布 Nano Banana 2.1,作为全面开放的图像生成和对话式编辑模型。其模型卡称该模型基于 Gemini 3.6 Flash,并将 Gemini 应用、AI Studio、Gemini API、Search AI Mode、Ads、Flow 和 Stitch 列为分发渠道。

读者如何使用:在 API 中,开发者选择gemini-nano-banana-2.1,提供文本并可选提供图像,然后读取图像和文本输出。图像生成指南说明最多可使用 14 张参考图像、输出尺寸和宽高比控制、可选的搜索 grounding 以及三个思考等级。创作者也可以在 Google AI Studio 或其他列出的 Google 产品中试用;模型卡的渠道列表并不能证明每个账户都拥有相同的访问权限或控制项。

为何重要:其付费 API 价格方面,标准 1K 输出图像的价格为 0.0336 美元,而 Google 价格页上的 Nano Banana 2 为 0.067 美元。这是指定 API 输出的价格比较,不是对图像质量或延迟的实测比较。BIG CHANGE 查阅了文档,但没有运行模型。

选择界面,再检查输出

想制作或修改图像、又不想构建集成的创作者,可以使用 Google 模型卡列出的 Gemini 应用和 Flow;开发者模型页面则直接链接到 Google AI Studio。确定工作流程前,应检查目标账户是否提供相应界面和产品控制项。

对于应用,API 指南当前示例使用Interactions API并搭配稳定的模型 ID。文本提示可以返回图像数据;编辑请求会加入图像数据和指令。模型页面将文本、图像、视频和 PDF 列为支持的输入,将图像和文本列为输出。不支持音频输入。指南称默认响应同时包含图像和文本,而response_format可以只请求图像,或指定宽高比和图像尺寸。默认图像尺寸是 1K;也可选 2K 和 4K。开发者模型页面列出的输入上限为 131,072 个 token,输出上限为 32,768 个 token。其表格不支持缓存、函数调用、结构化输出或 Live API。

参考图像有助于编辑和合成。Google 表示,一个工作流程最多接受 14 张参考图像,最多支持 4 个角色的相似度和 10 个物体的保真度。这些数字描述支持的输入和设计目标,并不保证每个主体都保持不变。Google 还提供minimal、medium和high思考设置,默认值为medium。该指南展示了 Google Web Search grounding 和可选的 Image Search 类型;应用必须配置搜索工具才能请求该功能。Google 表示,在这条图像生成路径中,网页图像搜索不支持使用真实人物的图像。

采用前,请确认目标账户提供相应界面,使用文档列出的模型 ID 和输入类型,并按实际展示尺寸检查返回图像。BIG CHANGE 没有完成该生成;本文梳理的是 Google 文档。

计算实际请求的价格

Google 的价格表没有为该模型提供免费的 API 套餐。标准付费费率为:文本、图像或视频输入每百万 token 1.50 美元;文本和思考输出每百万 token 7.50 美元;图像输出每百万 token 30 美元。Google 将图像费率换算为 1K 每张 0.0336 美元、2K 每张 0.0504 美元、4K 每张 0.113 美元。Batch 费率为相应 token 费率的一半,列出的图像等价价格为 0.0168、0.0252 和 0.0567 美元。Gemini 3.x 模型共用每月 5,000 次搜索 grounding 额度,此后每 1,000 次收费 14 美元。Google 提醒,一次用户请求可能触发多次计费搜索查询。部署高流量工作流程前,请查看实时价格页和账户结算设置。

Google 的测试结果与尚存限制

Google 表示,与早期模型相比,其视觉设计、编辑、文本渲染和主体一致性有所改善。在其2026 年 10 月模型卡中,公司介绍了人工并排偏好评估和单边自动事实性评分,并结合公开基准和内部数据集。该表中,启用 thinking 的 Nano Banana 2.1 信息图事实性得分为 0.521,而启用 thinking 的 Nano Banana 2 为 0.179。这些是 Google 在其选定条件下的评估结果。Decrypt 的发布报道也指出发布时缺少独立测试;该报道并未验证这些分数。

模型卡本身列出小字模糊、角色一致性不完美、蒙版编辑时只能部分遵循指令、左右混淆,以及事实性和空间推理方面仍有局限。它还提醒可能出现幻觉,以及请求偶尔变慢或超时。因此,使用搜索 grounding 的图像仍需核查事实,生产用途的图像也应按预定展示尺寸检查。API 指南称,所有生成图像均带有 Google 的 SynthID 水印。

集成时有一项文档冲突值得关注:模型卡称上下文窗口最高可达 100 万 token,并支持更大的文本输出;而API 模型页面列出的输入上限为 131,072 个 token,输出上限为 32,768 个 token。本文使用的是模型页面明确列出的 API 规格。Google 应统一这两组数字;开发者确定请求大小时应参考实时端点文档和账户限额。

来源与延伸阅读