Token导航 LogoToken导航

Qwen新1号位刘大一恒新作 Agent自主复刻应用

更新时间 2026-10-01来源 智猩猩正文 1880字阅读约 6分钟6 张图片
智猩猩AI整理
编辑:没方
Computer-Use Agents 长期沿两条平行路径发展,包括图形用户界面(GUI)操作应用,以及通过代码和命令行构建软件。
然而,这两条路径彼此隔离,GUI智能体能观察运行系统却难以构建软件,终端智能体虽能编写程序却无法感知自身操作产生的界面效果。  
可真实的数字工作需要两者融合,智能体需自主决定何时探索界面、何时实现代码、何时运行并视觉验证其产出。  
为此,阿里Token Hub团队开源了一套面向混合式 Computer-Use Agent 的五平台运行与评测框架 RecreationWorld,覆盖Ubuntu、macOS、Windows、Android 和 Web环境。
图片

在作者列表中发现Qwen大模型新负责人刘大一恒参与了这项工作。  

图片

RecreationWorld的核心任务设计是重现(Recreation):给定一个正在运行的参考应用,Agent 需要自行探索其界面和行为,再从零编写一个尽可能一致的可运行应用,并在探索、实现和验证之间自主切换,没有预设工作流。

由于参考应用本身可以作为可执行的“标准答案”,这套环境不仅能用于评测,也能持续生成带客观验证信号的训练轨迹。

实验表明,使用这些轨迹训练后,模型在 5 个分布外基准上均取得提升,最高增益达到 17.9 个百分点。  

01

让 Agent 自己“复刻”一个应用

RecreationWorld的核心任务,可以简单理解为“看着一个软件,把它重新做出来”。

对于每个任务,系统会向 Agent 提供一个高层任务描述、一个可实际操作的参考应用,以及同时具备 GUI 操作和软件开发工具的环境。

Agent 可以反复操作参考应用,也可以写代码、编译运行自己的版本,再将两者进行比较。

最终提交物不是操作轨迹,而是一套能够独立构建和运行的完整源码。

评估只关注最终可观察行为是否一致,并不要求 Agent 复现原项目的源码结构和技术栈。    

因此,这不是传统意义上的“看截图写前端”。 

Agent 首先需要通过点击、输入、切换窗口等操作主动探索参考应用,逐渐恢复一个隐藏的行为规格,接着把自己理解到的功能写成代码,然后实际启动程序,再从界面和行为上验证是否正确。

如果发现差异,就继续修改代码,或者重新回到参考应用寻找遗漏的信息。

研究团队将这一过程称为持续的探索—实现—验证循环。  

图片

为了支撑这种长轨迹任务,团队搭建了一套横向扩展的虚拟机基础设施。

每条 Rollout 都运行在相互隔离的 Worker 中,保留代码、进程和图形界面状态,单条任务最长允许运行 20 小时。

在 RECREATIONBENCH 中,一条轨迹中位数达到 282.5 次工具调用,GUI 与代码编辑之间平均每 100 次调用切换 9.08 次,明显体现出其混合式工作特征。  

图片

另一个关键设计是“可验证”。 

参考应用本身就是一个 Oracle。系统可以提前操作参考应用,记录点击某个按钮、输入某组数据之后应该出现什么结果,再把这些行为自动转换成隐藏测试。

测试分成两类:一类通过 AT-SPI、AXUIElement、UI Automation、UiAutomator、DOM 等接口检查文本、组件状态、导航和计算结果;另一类通过截图和 VLM 判断布局、颜色、Canvas 等视觉属性。

只有先在参考应用上成功运行、再经过人工审查的测试,才会被固定到最终评测集中。      

图片

02

对比实验与结果分析

团队首先用 Qwen3.8-Max 在 RecreationWorld 中生成训练轨迹,再根据任务验证器进行 Rejection Sampling,从五个平台分别筛选 7000 条高质量轨迹,总计构成 3.5 万条 SFT 数据。随后分别从 Qwen3.7-Plus 和一个经过持续预训练的 Qwen-Flash-CPT Checkpoint 出发进行微调。  

为了验证这种训练是否只会让模型“更会复刻软件”,研究团队进一步选择了 5 个分布外 Benchmark,覆盖纯 Coding、视觉编程以及 GUI+代码混合任务。 

结果显示,两组模型在最终 Checkpoint 上,5 个 Benchmark 全部高于初始 Checkpoint。其中 Qwen3.7-Plus 在 ProgramBench 从 41.9 提升到 44.6,GameCraft-Bench 从 17.9 提升至 26.5,Vision2Web 从 52.2 提升至 56.6,OSWorld 2.0 从 17.4 提升至 18.4,WeaveBench 则从 35.7 提升到 48.2。 

图片

这些结果初步表明,Recreation 训练带来的能力并不局限于“复刻应用”本身,其中涉及的代码生成、界面操作、视觉检查以及 GUI 与编程工具协同等能力,可以迁移到训练环境之外的 Agent 任务中。

文章标签Qwen阿里云智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多