谷歌(Google)日前正式发布新一代图像生成与编辑模型Nano Banana 2.1。作为Nano Banana 2的升级版本,新模型基于Gemini 3.6 Flash构建,重点提升图像编辑质量、文字渲染能力以及多轮编辑过程中的主体一致性。目前,该模型已开始接入Gemini以及Google面向个人和企业用户的多项AI产品。
根据Google介绍,Nano Banana 2.1在维持生成速度与成本效率的基础上,进一步改善了图像质量和提示词遵循能力,其中最核心的升级集中在连续编辑场景。当用户针对同一张图片进行多次修改时,模型能够更稳定地保留人物面部特征、服装细节以及物体外观,从而降低主体形象在编辑过程中逐渐偏离原始设定的问题。
为增强参考图利用能力,Nano Banana 2.1支持最多导入14张参考图片。模型可同时提取多张图片中的人物、物体与场景信息,并在生成结果中尽可能保留原始特征。其中最多可维持4名人物角色的一致性,也支持最多10个物体的特征继承。这使其能够胜任人物组合、产品展示以及复杂场景重构等创作需求。
图像编辑部分同样获得升级。用户可针对指定区域实施局部修改,同时尽量避免影响画面其他内容。例如调整服装、更换背景或修改物体颜色时,无需重新生成整张图片。Google还改进了基于遮罩与涂鸦的编辑机制,用户可直接圈选目标区域,再通过自然语言描述修改需求,以接近传统图像处理软件的工作方式完成编辑。
针对设计领域常见的文字生成需求,Nano Banana 2.1提升了海报、信息图以及复杂版式中的文字渲染能力,同时优化布局准确性。Google表示,新模型在信息图设计和文字内容准确性测试中取得进步。不过官方也指出,小字号文本、长段落内容以及复杂页面环境下,仍可能出现文字错误、模糊或排版异常等情况。
新版本还加入与Google Search及Google Image Search的内容关联能力。模型在生成图像时可结合搜索结果中的相关信息,从而在涉及现实世界知识、产品信息或特定场景资料的创作任务中减少事实错误。这一能力主要面向需要较高信息准确度的视觉内容生产场景。
为适应不同复杂程度的任务,Google提供minimal、medium与high三档Thinking模式。用户和开发者可根据需求在推理深度、生成速度以及使用成本之间进行选择。Google同时修复了超宽幅图像可能出现的纹理拼接问题,目前支持1:4、4:1、1:8和8:1等长宽比配置。
Google公布的内部测试数据显示,Nano Banana 2.1在图像生成与编辑项目中的整体表现优于上一代产品。在总体图像生成偏好测试中,启用Thinking模式的Nano Banana 2.1获得1050分,高于Nano Banana 2的990分和Nano Banana Pro的935分。在多人物一致性测试与多参考图编辑测试中,新模型也取得领先成绩。
不过,Google并未将Nano Banana 2.1定义为完全成熟的解决方案。官方模型卡显示,该模型仍可能产生幻觉内容,人物特征保留也无法保证绝对准确。在部分编辑任务中,模型可能错误继承人物姿态,或对左右空间关系产生误判。复杂三维空间理解能力以及事实准确性仍是后续优化方向。
目前,Nano Banana 2.1已开始接入Gemini、AI Mode、Flow、Google AI Studio以及Google Stitch等平台。Google此次更新的重点并非单纯提升单张图片的视觉效果,而是进一步强化连续创作流程中的可编辑性与稳定性。随着主体一致性、多参考图融合以及局部修改能力持续提升,AI图像模型正逐步从单次生成工具向完整视觉创作平台演进。