现在做复杂图像生成,问题已经不只是 Prompt 写得够不够详细。
如果用户要求生成一个真实地标,同时改变材质、加入指定文字、控制物体数量,还要保持正确的空间关系,仅靠把原始需求扩写成一段更长的 Prompt,很容易顾此失彼。
真正影响结果的,往往发生在正式生图之前。
模型需要先判断哪些信息自己不知道,哪些事实应该搜索,应该找什么参考图,文字排版、空间布局、材质表现又需要调用哪些生成知识。
最近,来自香港科技大学(广州)、香港科技大学、新加坡国立大学以及美团相关团队的研究者开源了 GenEvolve,把这些过去依赖人工经验完成的步骤交给一个能够自我进化的图像生成 Agent。

GenEvolve 的 Agent Policy 基于 Qwen3-VL-8B。它不直接替代图像生成模型,而是站在生成器之前,负责搜索信息、寻找参考图、调用生成技能,再把这些信息整理成最终可执行的生成方案。
同一套 Agent Policy 可以连接开源的 Qwen-Image-Edit-2511,也可以连接更强的闭源生成器 Nano Banana Pro。

结果也比较直接。
在 GenEvolve-Bench 上,搭配 Qwen-Image-Edit-2511 时,GenEvolve 的 KScore 达到 0.3663,高于 Gen-Searcher 8B 的 0.3493。
换成 Nano Banana Pro 后,同一套 Agent 又把 KScore 从原始生成器的 0.5298 提高到 0.5739。
在外部 WISE Benchmark 上,GenEvolve + Qwen-Image-Edit 的整体 WiScore 达到 0.82,超过 GPT-4o 的 0.80、Mind-Brush 的 0.78 和 Gen-Searcher-8B 的 0.77。
这项工作的重点,不是再训练一个更大的图像生成模型,而是把“生成之前应该怎么做决定”也变成可以训练的能力。

01
不再只改 Prompt,让 Agent
自己决定先做什么
很多图像生成工作流已经开始加入搜索和参考图,但工具能不能真正发挥作用,关键并不在于“有没有工具”。
更重要的是 Agent 是否知道什么时候该搜索、应该搜什么、哪张参考图值得保留,以及当前任务到底缺少哪一种生成知识。
GenEvolve 把一次完整的生成过程建模成一条工具编排视觉轨迹(Tool-Orchestrated Visual Trajectory)。
用户需求进入系统后,Agent 可以在多轮过程中调用三类工具。
search(q) 用于寻找文字证据。遇到真实人物、建筑、历史事件或科学事实时,Agent 不必完全依赖参数中的记忆。
image_search(q) 用于获取视觉参考。对于具体建筑、车辆、人物服饰和特殊物体,它可以先找到真实图像,再决定哪些参考值得交给生成器。
第三类是 query_knowledge(skill)。它不是搜索互联网,而是调用项目内部整理好的生成技能(Generation Skills),覆盖文字渲染、空间布局、人体结构、审美、材质、数量控制等生成问题。
这样一来,同样面对“真实建筑 + 特殊材质 + 指定文字 + 固定数量”这样的复杂要求,Agent 不再只是一次性写出一个超长 Prompt,而是先把任务拆开,再决定哪些部分需要外部事实,哪些部分需要视觉参考,哪些部分需要生成技巧。

经过多轮工具调用后,GenEvolve 最终生成的也不只是普通 Prompt。
它会组织出一个 Prompt-Reference Program,也就是生成指令与参考图集合。
检索到的事实、最终选中的参考图片、用户原始约束和调用过的生成知识都会被重新整理,再交给下游生成器执行。
这种设计还带来一个很重要的特点。
Agent 和最终负责画图的 Generator 被分开了。
因此,GenEvolve 学到的并不是某一个图像模型内部的固定技巧,而更接近一套“如何为生成器准备信息”的工作方法。
这也是为什么官方可以把同一套训练后的 Agent Policy 分别接到 Qwen-Image-Edit 和 Nano Banana Pro 上,并且两种设置都获得提升。
02
不只看最后哪张图更好,还要
学会好在哪里
有工具之后,另一个问题很快就会出现。
如果一次生图任务经历了搜索、选图、技能调用和 Prompt 构建十几步,最后只给生成结果一个分数,Agent 很难知道到底是哪一步做对了。
一次结果更好,可能是搜索关键词写得更准确,也可能是参考图片选得更合适,还可能是提前调用了文字排版或空间布局知识。
单一的图片级奖励只能告诉 Agent 哪条轨迹整体更好,却无法直接指出轨迹内部哪些决策最值得学习。
GenEvolve 的核心做法,就是把同一请求下的多条生成轨迹拿出来比较。
系统会寻找表现最好和最差的轨迹,再把两条轨迹之间真正重要的差异整理成结构化的视觉经验(Visual Experience)。
这些经验围绕搜索策略、生成知识调用、参考图选择、Prompt 构建以及失败规避等关键环节展开。
换句话说,训练信号不再只有一句“这张图分数更高”。
Agent 还能进一步得到类似这样的经验。
搜索时应该把一个复杂事实拆成更准确的查询。
某种任务只知道事实还不够,需要额外调用文字渲染技能。
参考图数量并不是越多越好,应该明确每张图承担什么作用。
空间关系不能只用模糊描述,而应该在最终生成指令中明确锚定位置。
这就是论文提出的视觉经验蒸馏(Visual Experience Distillation)。
更关键的是,这些经验不会变成推理时必须携带的额外“记忆库”。
训练过程中,结构化经验只提供给一个拥有特权信息的 Teacher 分支,Student 仍然看到正常的输入。系统再通过 token 级蒸馏,把 Teacher 在关键决策上的偏好逐步压进 Student。
因此部署完成后,GenEvolve 不需要每次都重新拿出这批训练经验,它已经把相关决策方式学进了 Policy。
这也让 GenEvolve 的自进化过程形成一个闭环。
Agent 先生成更好的轨迹,更好的轨迹又能产生更有价值的视觉经验,这些经验继续用于下一轮训练。
项目将 GRPO 和 Visual Experience Distillation 结合起来。前者主要提供轨迹级的强化学习信号,后者进一步提供更细的 token 级决策监督。
这也是 GenEvolve 和单纯“生完图以后打个分”的 Agent 训练方式最明显的区别。
03
9000条轨迹起步,换成更强生成器
仍然继续提分
为了训练和评估这套系统,团队还构建了 GenEvolve-Data 和 GenEvolve-Bench。
整个数据体系主要覆盖两类复杂图像生成任务。
一类是 Knowledge-Anchored。它要求生成过程依赖外部事实,包括真实人物、地点、历史事件、建筑和特定物体。
另一类是 Quality-Anchored。它更关注图像本身容易出错的能力,包括文字、空间布局、数量、人体结构、属性绑定、材质和审美表现。

目前官方已经公开 9000 条 SFT 工具轨迹,对应约 5 万张参考图片,用于自进化训练的部分包含 3175 条 Prompt 和 3175 张 GT 图像。
最终 GenEvolve-Bench 则包含 594 条 held-out 测试样本,其中 335 条属于 Knowledge-Anchored,259 条属于 Quality-Anchored。
真正能说明这套 Agent 编排方式价值的,还是换生成器之后的表现。
在 GenEvolve-Bench 上,原始 Qwen-Image 的 KScore 为 0.2987。Gen-Searcher 8B 搭配 Qwen-Image-Edit-2511 后达到 0.3493,而 GenEvolve + Qwen-Image-Edit-2511 达到 0.3663。
换成 Nano Banana Pro 后,原始生成器得分已经达到 0.5298,Gen-Searcher + Nano Banana Pro 为 0.5481,GenEvolve + Nano Banana Pro 进一步提高到 0.5739。
这组结果比较重要,因为它说明 Agent 端学到的能力并没有被锁死在一个具体生成器上。
底层生成器变强后,GenEvolve 仍然可以继续改善搜索、参考选择和生成程序组织,从而把更强的生成器进一步用好。

外部 WISE Benchmark 更能说明它有没有只在自己的数据上占优势。
GenEvolve + Qwen-Image-Edit 在六类知识密集型图像生成任务上的 Overall WiScore 达到 0.82。
其中 Cultural 为 0.84,Time 为 0.74,Space 为 0.87,Biology 为 0.83,Physics 为 0.81,Chemistry 为 0.83。
最终整体得分超过 GPT-4o 的 0.80、Mind-Brush 的 0.78,以及 Gen-Searcher-8B + Qwen-Image 的 0.77。

除了数字,项目还公开了大量实际生成案例。
这些任务包括真实建筑、创意风格迁移、文字布局、空间组合、人体动作、车辆结构、材质物理、数量控制和属性绑定等。
项目主页还提供完整的 Agent Workflow,可以直接看到 Agent 如何先搜索参考,再调用相关生成知识,最后整理出 Prompt-Reference Program。

GenEvolve 真正改变的,并不是图像生成器本身。
它把搜索什么、找哪张图、应该调用什么生成知识、最后怎样组织 Prompt 和参考信息这些过去散落在人工工作流中的步骤,统一变成了 Agent 可以学习和优化的决策过程。
过去不少图像 Agent 已经会“调用工具”。
GenEvolve 更进一步的问题是,怎样让 Agent 从成功和失败的工具调用轨迹里持续学会把工具用得更好。
这也是 Visual Experience Distillation 最值得关注的地方。
生成器继续负责把图画出来,Agent 则开始学习怎样为生成器准备更可靠的信息和执行方案。
目前官方已经公开 GenEvolve Agent 权重、推理 Runtime、三类工具、8 个生成 Skill、SFT 与自进化数据、GenEvolve-Bench,以及 Qwen-Image-Edit 和 Nano Banana Pro 的调用封装。







