IT之家 10 月 7 日消息,谷歌于今日正式发布了 Nano Banana 2.1,这是该公司 AI 图像生成与编辑模型的升级版本。谷歌强调,新版 Nano Banana 2.1 实现了全方位提升,在视觉设计、基于蒙版的图像编辑以及主体一致性这几方面的进步尤为突出。
今年早些时候,谷歌推出了 Nano Banana 2,也被称作 Gemini 3.1 Flash Image。Nano Banana 2 在拥有谷歌 Flash 系列模型高速特性的同时,实现了与 Nano Banana Pro 同级别的出图质量。谷歌还把多项原本属于 Pro 版本的功能下放至这款定位更低的模型,包括现实世界知识库、文字渲染效果优化,还有角色与物体的一致性表现提升。
IT之家注意到,Nano Banana 2.1 在原有能力的基础之上,主要在三大方向做出改进:
视觉设计:Nano Banana 2.1 可以生成构图效果更佳、完成度更高的视觉素材。
蒙版编辑:用户能够更加精准地选中并修改现有图像的局部区域,无需重新生成整张画面。
主体一致性:在执行编辑操作或者批量生成多张关联图片的时候,模型可以更好地保留画面主体的样貌与特征。
改进后的主体一致性对于 Gemini 用户而言实用性很强,可以保证同一个人物或者物体在多次生成结果当中保持样貌统一。谷歌 Nano Banana 2.1 现已逐步部署上线,覆盖 Gemini 应用、谷歌搜索的 AI 模式、Google AI Studio、Google Flow、Stitch、谷歌广告以及 Gemini 企业平台。
面向开发者,Nano Banana 2.1 已经正式开放,对应的模型 ID 为 gemini‑nano‑banana‑2.1;该模型支持文本、图片、音频以及视频输入,同时可以输出 1K、2K 以及 4K 分辨率的图像。
目前,OpenAI 的 ChatGPT Images 2.5 依旧是全球领先的图像生成编辑模型。在用户持续微调一张图片时,它更擅长保留上一轮的修改成果,不会改动没有编辑的区域,也不会随着反复迭代让原图画质变差。紧随 OpenAI 这款产品之后的是微软 AI 的 MAI‑Image‑2.6 模型,该模型于今年 8 月发布。