产品#图像生成

谷歌 Nano Banana 2.1 发布

中文文字渲染大幅改善,支持 4K;2K 每张 0.050 美元、4K 0.076 美元,恰为上一代一半。

Google AI Studio 官方「介绍 Nano Banana 2.1」横幅,霓虹 2.1 字样与香蕉

谷歌发布 Nano Banana 2.1(gemini-nano-banana-2.1)——Nano Banana 系列的最新一代图像生成与对话式编辑模型,10 月 6 日起 GA。AI 博主「歸藏的AI工具箱」第一时间上手实测:中文的文字清晰度和错字问题大幅改善,中文字体设计与排版「没有 GPT 那种破碎感,画面干净」;与 GPT 系竞品相比的主要优势是 4K 输出——「感觉一下又有用了」。

要点

  • 定位:Nano Banana 2 的高效升级版,图像生成 + 对话式编辑,速度与成本对标 Flash 档
  • 分辨率:1K / 2K / 4K 三档输出(Gemini 3.1 Flash Image 才有的 512px 档不含)
  • 中文实测:文字清晰度与错字率大幅改善,中文字体排版美学明显提升(博主实测口径)
  • 定价:输出图像 $30/百万 token——2K 每张 $0.0504、4K 每张 $0.0756,恰为上一代的一半
  • 能力:最多 14 张参考图编辑、Google 搜索与图搜 grounding、Thinking 三档推理、视频转图像、全输出 SynthID 水印
  • 接口:Interactions API(generativelanguage.googleapis.com/v1beta/interactions)

价格腰斩的算法

官方定价页把账算得很透明:两张模型的每张图 token 消耗相同(1K=1120、2K=1680、4K=2520),价格差全部来自输出 token 单价——$30 对上一代的 $60。换算成创作者语言:4K 出图从每张 $0.151 降到 $0.076,批量出图的工作流(电商、社媒配图)成本直接减半。但注意输入价反向上涨:$0.50 → $1.50(三倍),多参考图的重编辑场景要重新算账。

中文渲染为什么是大事

图像模型的中文文字渲染长期是短板——招牌、海报、UI mockup 里的汉字经常是「看起来像字的噪声」。这一代把 14 张参考图编辑与 4K 输出组合起来,海报级交付的完整工作流第一次都在一个模型里;歸藏的实测把「中文可用」列为 2.1 的头号变化,这对中文市场的电商与设计工具链是直接的生产力变化——此前需要「生成 + PS 改字」两步的活,现在一步到位;配合 4K 输出,出片从「预览稿」升级到「可交付稿」。验证路径也简单:同一提示词在 2.0 与 2.1 各跑一轮,对比招牌文字的笔画正确率——这一步任何用户都能在 AI Studio 里十分钟内做完,也是判断「中文改善」成色的最诚实方式。

与竞品的格局对照

图像生成赛道的价目表如今排得很密:FLUX.3 的极高保真路线、GPT 系的原生多模态、Midjourney 的订阅制,以及 Nano Banana 的「token 计价 + 对话式编辑」。2.1 的差异化在于三点组合:对话式迭代(改图不用重写提示词)、搜索 grounding(生成时能引用真实图像参考)、以及谷歌云的用量计费——对工程团队,最后一点往往比跑分更决定选型——计费可预测性在预算会上比任何基准图都有说服力。歸藏实测里「没有 GPT 那种破碎感」的评价,针对的正是多轮编辑后画面崩坏的老问题——这也是对话式编辑从演示走向生产的关键分界。

又一次效率降价

Nano Banana 系列走的是「Flash 价格 + Pro 质量」路线,这次输出减半、输入三倍的定价结构调整,说明谷歌在为高频对话式编辑场景(多轮、多参考图)重新分配成本——编辑越多,输入占比越高。回到那条主线上:模型能力的单位成本每半年砍半,而质量评价标准随之上移——上一代的「像不像」已经是这一代的默认项。对开发者,图像模型的竞争已经卷到「每张图几分钱」的颗粒度;对用户,全输出带 SynthID 水印则是这一代模型的共同底色。