
在作者列表中发现Qwen大模型新负责人刘大一恒参与了这项工作。

由于参考应用本身可以作为可执行的“标准答案”,这套环境不仅能用于评测,也能持续生成带客观验证信号的训练轨迹。
实验表明,使用这些轨迹训练后,模型在 5 个分布外基准上均取得提升,最高增益达到 17.9 个百分点。
01
让 Agent 自己“复刻”一个应用
对于每个任务,系统会向 Agent 提供一个高层任务描述、一个可实际操作的参考应用,以及同时具备 GUI 操作和软件开发工具的环境。
Agent 可以反复操作参考应用,也可以写代码、编译运行自己的版本,再将两者进行比较。
最终提交物不是操作轨迹,而是一套能够独立构建和运行的完整源码。
评估只关注最终可观察行为是否一致,并不要求 Agent 复现原项目的源码结构和技术栈。
因此,这不是传统意义上的“看截图写前端”。
Agent 首先需要通过点击、输入、切换窗口等操作主动探索参考应用,逐渐恢复一个隐藏的行为规格,接着把自己理解到的功能写成代码,然后实际启动程序,再从界面和行为上验证是否正确。
如果发现差异,就继续修改代码,或者重新回到参考应用寻找遗漏的信息。
研究团队将这一过程称为持续的探索—实现—验证循环。

为了支撑这种长轨迹任务,团队搭建了一套横向扩展的虚拟机基础设施。
每条 Rollout 都运行在相互隔离的 Worker 中,保留代码、进程和图形界面状态,单条任务最长允许运行 20 小时。
在 RECREATIONBENCH 中,一条轨迹中位数达到 282.5 次工具调用,GUI 与代码编辑之间平均每 100 次调用切换 9.08 次,明显体现出其混合式工作特征。

另一个关键设计是“可验证”。
参考应用本身就是一个 Oracle。系统可以提前操作参考应用,记录点击某个按钮、输入某组数据之后应该出现什么结果,再把这些行为自动转换成隐藏测试。
测试分成两类:一类通过 AT-SPI、AXUIElement、UI Automation、UiAutomator、DOM 等接口检查文本、组件状态、导航和计算结果;另一类通过截图和 VLM 判断布局、颜色、Canvas 等视觉属性。
只有先在参考应用上成功运行、再经过人工审查的测试,才会被固定到最终评测集中。

02
对比实验与结果分析
团队首先用 Qwen3.8-Max 在 RecreationWorld 中生成训练轨迹,再根据任务验证器进行 Rejection Sampling,从五个平台分别筛选 7000 条高质量轨迹,总计构成 3.5 万条 SFT 数据。随后分别从 Qwen3.7-Plus 和一个经过持续预训练的 Qwen-Flash-CPT Checkpoint 出发进行微调。
为了验证这种训练是否只会让模型“更会复刻软件”,研究团队进一步选择了 5 个分布外 Benchmark,覆盖纯 Coding、视觉编程以及 GUI+代码混合任务。
结果显示,两组模型在最终 Checkpoint 上,5 个 Benchmark 全部高于初始 Checkpoint。其中 Qwen3.7-Plus 在 ProgramBench 从 41.9 提升到 44.6,GameCraft-Bench 从 17.9 提升至 26.5,Vision2Web 从 52.2 提升至 56.6,OSWorld 2.0 从 17.4 提升至 18.4,WeaveBench 则从 35.7 提升到 48.2。

这些结果初步表明,Recreation 训练带来的能力并不局限于“复刻应用”本身,其中涉及的代码生成、界面操作、视觉检查以及 GUI 与编程工具协同等能力,可以迁移到训练环境之外的 Agent 任务中。







