Token导航 LogoToken导航

OpenAI入局Personal Agent图形界面新进展

更新时间 2026-10-08来源 白鲸实验室正文 4800字阅读约 15分钟3 张图片
图片

创办过企业身份云平台Authing,做出过AI浏览器Fellou的谢扬,今年3月把精力投向了Personal Agent。不过,谢扬对Personal Agent的理解,与当前的几个主流产品不太一样。

当前大众视野里的两款Personal Agent,是Meta的Muse和OpenAI的Dots。Muse是在云端开一个浏览器,能替用户处理邮件、日历、支付和购物,Dots号称可以连接4000多个App替用户办事。

这意味着,理想情况下用户只需要面对一个App或对话框,背后由AI Agent去调用、串联更多App,替用户完成原本需要在多个应用之间来回切换的工作。

甚至有一种声音认为未来App会消失,最后只剩对话。这当中的典型代表产品是Instinct,它没有新的界面,拥有自己的虚拟电话和电脑,并像人一样操作手机、电脑和互联网,用户可以发短信和打电话给它,AI Agent会帮你订餐、订票、回邮件。

以上的各种技术路线,本质上都是依赖于传统的命令行。但谢扬有着一种观点,他认为,Personal Agent的终点不该是一个更聪明的命令行,更应该是由图形化展现的形态。背后的逻辑是,图形界面才更符合大多数人与AI交互的形态。

基于这个理念,他和团队研发出以App为中心的图形化Personal Agent——Eazo。别的Agent替你操作别人的App,Eazo为你造一个只属于你的App。也就是说,用户只要把需求说清楚一次,之后在生成的图形界面APP上点一下就好。

关键是这事不只谢扬的团队在做,最近连OpenAI都承认聊天框不是终点。10月8日凌晨,OpenAI发布GPT-6与Intelligent UI,这意味着ChatGPT从此会按问题生成界面,文字、图表、按钮、表单乃至可交互的小工具,由模型自己决定在画布上放什么。

官方举的例子包括,多人聚餐分账工具,改人数就自动重算用量的家宴采购计算器等。如果这已经是个趋势,那么Personal Agent会迎来“图形界面时刻”吗?

01 

为什么是图形界面

作为Personal Agent,Eazo的核心理念与传统的命令行大有不同。

今天市面上大多数Personal Agent,本质上是把对话当成了终点,你说一句,它办一件,你说得越多,它办得越多。这样的人机交互并不十分自然,或许只是个过渡。

谢扬认为,对话应该是用来造东西的,不是每件事都要靠对话来做,对话是表达新需求的最好方式,却不是重复使用的最好方式。如果一个需求每次都要重新组织语言,描述意图,等待AI理解和执行,对话本身就成了一种负担。

从人机交互的发展史来看,技术一直在让人与机器的沟通变得更自然。最初是只有少数人会使用的命令行,后来多数人能用图形界面,再到更多人开始使用触屏。每一次跃迁,其实都在减少人对文字和指令的依赖,目的让机器离大多数人的直觉更近。

这种直觉,应该是对一个充满颜色、声音、动态的世界有较强烈的感知。

Eazo作为以App为中心的图形化Personal Agent,向用户提供一个更轻松自然的操作方式。用户可以用Eazo造自己想要的App,造的时候用简单的自然语言,但造完那一刻,用户就不再需要对着它说话了,只需用手指在图形界面上点一下。

图片

Eazo造的学习英语的App

对大多数人来说,图形界面确实比对话更友好。从实际生活出发会发现这不难理解,因为高频、重复的需求,点一下永远比说一句快,每天都要做的事,几乎没有人愿意每次都重新描述一遍。

谢扬打过一个比方:对话是用来装开关的,不是用来开灯的。装灯的时候,你只要告诉电工一次,把开关装在床头,之后每天晚上伸手一按就好。

等于说,别的Personal Agent让你每晚喊一声 "关灯",Eazo帮你把开关装在你想要的地方。就像Intelligent UI让每次喊"开灯"时,屏幕上多出一个好看的按钮。

这其实点出了Personal Agent一个容易被忽略的问题,Agent真正要解决的,可能不是让人更高效地发号施令,是让人越来越少发号施令。

我们不会每天对手机说“打开微信”,也不会每天对电脑说“把音量调低”,因为这些需求早已经被做成了按钮、图标和快捷方式。同理,Agent也应该把一次性的对话,沉淀成长期可用的界面。

这里有个用户案例。Adam Waxman家里请了睡眠顾问,对方给的计划是一份写满条件判断的PDF:清醒时长、小睡上限、小睡失败后怎么办。Adam Waxman花了几个晚上,用Eazo把它做成App,现在他、妻子和保姆三个人共用同一份实时作息表,小睡时间短了,作息会自动重排。

做的人用对话,用的人只需要点击。后来这个App用了大约四个月就退役了,但Adam Waxman并不心疼,因为他只花了几个晚上去做,用了好几个月已经很值。

OpenAI和Eazo盯住的这种图形界面,日常生活中场景其实很多。

试想一下,我们每天都要做的事,点一下是不是比描述一遍快,比如记一笔账,打一次卡。很多时候我们说不清自己要什么,但一看到选项就知道,就像点菜要看菜单。全家的家务谁来做、这周谁买菜,挂在那里扫一眼,比问一遍清楚。

语音的优势是让AI听懂用户想要什么,图形界面的优势则是让用户不用每次再解释一遍。这或许才是更合理的。

02

每一步都是完整的App

AI发展到今天,用AI造自己想要的软件其实已经不是什么稀罕事,包括国内一些大厂也都在跟进这个赛道。

不过,Eazo的特点是以App为中心的Personal Agent,用户做完不是终点,每个作品都会进入Eazo社区,在那里被发现、被使用、被 remix,甚至能变现。

相较而言,Eazo确实有着更丝滑的体验。 对于用户任何模糊的需求,Eazo都能把它变成完整、好看、可用的应用。你只需要随口说一句模糊的话,比如 "构建一个基于AI的英语学习应用,它可以从YouTube视频和播客中学习......",剩下的交给AI,它帮你想清楚,也帮你做完整。

更大的亮点是,Eazo追求Wild Design——从模糊需求到百分产品。对于同一个模糊需求,六个风格各异的专业视觉方向并排摆在眼前,像翻开一本杂志,排版、配色、气质完全不同,打破此前人们认为的“AI 做的都长一样”这种认知。你只需要指着其中一个说,就它了。

使用过程,总能发现Eazo以用户体验为本的思路。Eazo把设计师的审美判断和修改方法,沉淀成了Agent可调用的技能,用户说 "更温暖"" 简洁一点 ""保留这个感觉",Agent会把这些模糊感受翻译成具体的调整 —— 色彩、字体、布局改哪里,哪里保留。

不用懂设计术语,也能一步步把作品改到自己满意。本质上,这是把用户的审美感受转化为具体的设计调整,让用户知道还能怎么改、每次改了什么,并保留对创作方向的控制。

生活中你的任何创意和灵感,基本都可以用Eazo实现。Instagram上有位博主,分享了他男朋友用Eazo做的一个Dating邀约App,有趣的是,这个Dating邀约被设计成“无法拒绝”。

凭借这个创意,该视频小火了一下,在Instagram上获得了200多万播放。

其实Eazo的创作能力还不止于界面。它从UI一路延伸到图像、3D角色与场景、动画和音频,除了优化WebGL和3js的体验,还提供云Blender与3D生成工具(Tripo/Hyper3D),配合自研的3D动画和游戏制作工作流,Agent甚至能自主搜索调用动画与其他资产素材。

这意味着用户可以在同一个创作对话里,把视觉资产和应用一起做出来,不用切到任何别的工具。

对很多用户来说,Eazo最大的吸引力是,应用上线就能立刻赚钱,还可全球收款。过去接支付是最劝退的一环,注册商户、过审核、写支付接口、处理汇率和合规,任何一个环节都能让小白卡死。而Eazo直接把 Stripe直接集成好,应用上线就能收钱,全球的买家都能付款。

从创作到变现,Eazo把商业模式直接跑通了。用户做出来的东西,不再只是作品,变成能立刻变成收入的生意。对一个独立创作者来说,一个人、一句话、一个App,就是一个完整的生意闭环。

最值得一提的是,在真实创作任务评测中,Eazo超过了Codex,成本也比Codex更低。

Eazo Benchmark是一套面向创作Agent的评估体系。从真实用户场景里抽出103道任务,覆盖从理解需求、处理素材,到设计、开发、交付的完整链路,同一个任务,Eazo和Codex各跑一遍,用同一套标准打分。

结果综合质量均分Eazo 88.5,Codex 84.2。 Eazo在七个能力维度全部领先,开发与运行+6.8、资产获取与整合+5.7、意图路由与设计深度+4.8,领先最小的横切能力也有+1.2。

图片

更难得的是效率,每个任务平均耗时11.1分钟对11.7分钟,Eazo的Token用量少了12%。这意味Eazo做得更好,还花得更少。

这种差距来自其自研框架EazoTack。EazoTack重构了五次,采用四层架构,执行Agent用缓存优先的上下文管理,并在子任务复用上下文。只靠15个基础工具和1个元工具,就能调用抠图、3D生成、并行设计、浏览器验证等能力。7天全网缓存命中率达98.3%,首Token 响应时间仅1.5 秒,成本比Codex还低三分之一。

03

背后的隐形杀招,是Qoni

Eazo之所以具备Personal Agent的能力,因为背后有几个强大的能力系统来支撑。Qoni就是提供这些能力系统的托管基础设施。

可以这么理解,如果说Eazo是给每个人的Personal Agent,Qoni 就是让每个开发者、每个企业都能造自己或员工的 Personal Agent。

Qoni真正解决了几个大的问题。一个 Personal Agent要能干活,底下得有三样东西,身份系统(它得能进公司的系统)、行动系统(它得能在真实网页和软件里操作)、记忆系统(它得记得住人)。

每一件都极其难做,搭身份要对接企业账号体系,行动要处理真实浏览器,记忆要长期存储还能追溯。

早在2001年,万维网的发明者Tim Berners-Lee就提出了一个构想:未来的网页不只是给人读的文档,软件Agent也能读懂网页的含义,替人安排预约、比较选择、处理事务。

但二十多年过去,今天仍然未能真正成熟地落地,原因正是在于,一个 Agent光读懂网页远远不够,缺了身份和记忆。

现在谁想做Personal Agent,基本都得从零搭这三样。

而Qoni就是把这最难的三样,做成了开箱即用的服务。开发者不用自己搭服务器,不用自己造身份和记忆系统,用一套SDK接进来,就能给 Agent配上身份、行动和记忆。就像App开发者用云服务一样,以前要自己买服务器、自己运维,现在直接用托管好的服务,按需接入。

从谢扬的创业经历来看,Qoni这套底座并非从零搭起来的。

身份能力来自早年谢扬做的产品Authing,延续为今天的GenAuth,浏览器与行动能力来自Fellou,记忆能力来自谢扬过去对知识图谱的研究。等于说,谢扬此前做过的产品仍在发挥其价值,走过的每一步都算数,如今那些步子汇成了Qoni这条线。

其实不难看出,Qoni的野心不只停留在一个产品上,它想要把造 Personal Agent的能力开放给所有人。

早期互联网有一个非常朴素的愿望:让信息可以被所有人平等获取。2012年伦敦奥运会开幕式上,万维网发明者Tim Berners-Lee曾在屏幕上写下那句著名的话:“This is for everyone.”

同样,谢扬似乎已经不是简单地造一个Personal Agent,是想让企业、开发者和普通人,都能平等地获得智能。Eazo负责让人更自然地使用Agent,Qoni则把造Agent的门槛进一步拉低。两者以及更多产品一起,推动Personal Agent从少数技术公司的实验,走向更多人的日常。

如今连OpenAI都已入局,或许Personal Agent的“图形界面时刻”能早早到来。

文章标签OpenAI智能体AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多