
过去一个月,Personal Agent 正在迅速变成 AI 应用里最拥挤的方向之一。
9 月初,Meta 推出 Muse,为每个 Agent 配备持续运行的 Secure VM 和独立浏览器,让它能够跨网页完成预约、填表、客服等任务;月末,OpenAI 发布 dots,同样让 Agent 拥有自己的云端电脑,并通过插件连接大量外部应用。Manus 推出的 Cue 更进一步,为不同的 Personal Agent 配置独立的电话号码、邮箱、钱包和电脑。Personal Agent 正在获得持续运行的环境、数字身份和真实世界的执行能力,逐渐成为能够长期代表用户行动的数字角色。
软件行业也因此重新讨论 App 的命运。
Airbnb CEO Brian Chesky 的判断是:“all apps need to become agents”。但这句话还有一个同样重要的后半段:这些 Agent 必须能够互联,并拥有“much richer user interfaces”。他并不认同未来所有 App 都退化成一个万能输入框的数据层。例如旅行场景下,浏览房源、比较选择、查看地图、联系房东、完成身份验证,就需要不同的信息密度和交互方式。
这之间的张力正在变得明显。一边是 Agent 的能力边界快速扩张,越来越多原本需要在人与软件之间手动完成的操作正在被自动化;另一边,交互界面却被想象得越来越单一——似乎只要模型足够聪明,所有软件最终都可以收缩成一个对话框。
模型已经越来越擅长理解人的语言,Agent 也开始穿透原本割裂的 App 和网站,于是最容易产生的一种想象,是未来所有软件都退到后台,用户只需要面对一个万能输入框。但一个 Agent 能够替人操作多少软件,和人应该以什么方式使用这个 Agent,并不是同一个问题。
搜索餐厅、临时订机票、把三十封邮件整理成五个待办,自然语言已经足够高效;但家庭账务、儿童学习、健康记录、旅行协作这些长期场景,需要持续保存状态、反复查看和多人修改。如果每一次使用都要求用户重新面对文字框、组织语言、确认意图,自然语言反而会重新变成一种“命令行”。
Eazo 从另一个方向理解这件事:自然语言可以成为生产软件的入口,却没有必要承担软件被长期消费和使用的全部过程。复杂意图第一次出现时,用一句话表达;一旦需求稳定下来,就把它沉淀成可以看见、可以点击、可以共享的界面。
沿着这条路径,Personal Agent 的价值不再只是替用户操作既有软件,也开始直接围绕个人需求生成新的软件。让原本只能存在于对话里的意图,变成一套能够持续存在的数字工具。

对话框不是 Personal Agent 的终局
让机器直接听懂人话,大概是计算机历史上最持久的一种想象。从《2001:太空漫游》里的 HAL 9000、《星际穿越》里的 TARS,到 Siri、Alexa,人一直希望绕过菜单和说明书,直接告诉机器自己想做什么。只是很长时间里,自然语言更多是一层薄薄的入口:机器能够理解几类固定意图,却仍然要求人适应软件已经设计好的结构。
大模型真正改变的是这层关系。
一个旅行需求可以从一句“春节想找个暖和、人不要太多的地方待五天”开始,而不是先打开机票、酒店和攻略网站;面对上百封邮件,也不再需要先建立过滤规则,Agent 可以直接从语义里识别哪些事情值得处理。对于低频、临时、路径复杂的任务,语言确实接近理想接口。它把软件菜单、信息架构和操作步骤从用户面前拿走,只留下目的本身。
但大量真实生活并不是由一次性 Task 构成的。每天面对同一个文字框,用户就要反复把已经表达过的意图重新组织成语言,还要确认模型是否理解正确。对于老人、幼童,或者需要多人共同维护状态的家庭场景,这种摩擦更加明显。
幼儿的作息变化、家人的服药记录、两个人共同维护的家庭开支、一趟旅行每天变化的预算和路线,都不是完成一次便结束的任务。它们会在几天、几个月甚至几年里积累状态,而且往往同时被多个人反复查看、修改。这时候,界面的价值重新出现。
GUI 最重要的功能从来不只是“有几个按钮”。它实际上替用户保存了大量已经做过一次的思考:什么信息放在一起,什么动作最常发生,哪些状态值得同时看到。一个按钮,本质上是一条被产品设计提前压缩好的命令;一个 Dashboard,则把几十次询问压缩成一眼可以扫过的状态。
这里甚至可以看到一条贯穿计算机交互史的脉络。命令行把操作组织成字符串,GUI 把它们变成可以识别的位置和图形,触屏又进一步把常见动作压缩成点击、拖动和手势。几十年的人机界面演进,一直在用空间记忆和视觉识别,减少人主动检索命令、组织语言的负担。
大模型没有让这套逻辑过时。它改变的是 GUI 出现之前的环节:用户不再需要知道一个软件应该怎么设计,只需要表达自己的目的。这也是 Eazo 这条路线更值得关注的一层。自然语言不再被要求承担完整的软件生命周期,而是负责把尚未成形的意图带入软件生产;当需求逐渐稳定,信息架构、数据关系、视觉表达和交互方式再被沉淀为按钮、卡片和页面——对话用来创造,界面用来使用。
这种变化已经开始进入最主流的 AI 产品。就在 10 月 8 日凌晨,OpenAI 推出 GPT-6 与 Intelligent UI,ChatGPT 开始根据具体问题主动组织回答形态:除了文字,还可以即时生成图表、按钮、表单以及可以直接操作的小工具。OpenAI 对这一方向的描述是,让 ChatGPT 能够围绕用户正在完成的任务“塑造界面”,甚至进一步提出,未来不再只是人适应固定的软件,而是软件开始适应人。

随着模型理解能力继续提高,AI 对 GUI 更深层的改变不是把它消灭,反而是让它从固定的软件外壳变成模型可以动态生成的表达方式。但 Intelligent UI 目前仍以一次问题为基本单位——界面随回答生成,也留在对话之中。再往前一步,则是另一种产品命题:一次已经被理解的需求,能否不随着这轮对话结束,而是继续沉淀成拥有数据、状态和完整工程能力的软件,第二天、一个月后仍然可以直接打开使用。
Eazo 选择把界面生成继续向这个方向推进。GUI 不再只是为当前问题临时组织的一次回答,而开始成为可以保存、复用、分享,并持续承载个人状态的 Personal Software。

当软件的最小市场缩小到一个人
传统软件工业建立在规模经济上。一个需求要经历产品、设计、前后端开发、测试、部署和长期维护,最终必须覆盖足够大的用户群,才能摊平这套成本。因此 App Store 已经拥有海量产品,但用户仍然常处在一种尴尬状态:软件琳琅满目,但真正轮到自己的具体需求时,只能在几个“不完全合适”的产品之间妥协。
一只正在接受几个月治疗的宠物需要一套特殊的用药记录;一个家庭有自己独特的账务分摊方式;孩子只在某个年龄阶段需要一套识字卡。它们都很具体,也都太短暂、私密,无法规模化。软件公司没有理由专门去做。
生成式 AI 改变的是软件生产的成本曲线。当产品、设计、开发和部署越来越多地可以由模型与 Agent 完成,软件成立所需要的最低用户规模也随之下降。原本只能存在于备忘录、Excel 或聊天记录里的小需求,开始具备被单独做成软件的条件。
Personal Software 真正激进的地方正在这里:一个 App 的全部市场,理论上可以只有一个人。
“英语学习 App”就是一个直观案例。用户最初的想法并不复杂:把自己平时真正会看的 YouTube 视频和 Podcast 导入进来,自动将语音转成文本;学习时可以调节播放速度进行跟读,遇到生词直接标记,并由 AI 解释词义。
但一句“帮我做一个基于 YouTube 和 Podcast 的英语学习 App”落到产品里后,很快就会出现大量没有被提前说出的决定:视频与逐句文本如何对应,跟读时怎样控制播放和定位,生词解释以什么方式出现,已经标记的词如何保存,播放器、文本和学习进度在一个页面里怎样组织。需求只有一句话,真正的软件却由几十个细小判断共同组成。
这也说明,代码只是软件生产链条里最显性的部分。Claude Code、Codex 等 Coding Agent 已经显著降低写代码的门槛,但普通用户仍然被要求同时扮演产品经理、设计师和运维工程师。代码门槛下降以后,需求拆解、信息架构、视觉选择和工程交付反而更清晰地暴露出来。
这也是操作型 Personal Agent 与生成型 Personal Agent 的关键区别。Muse、dots 代表的路径,是进入已有网站和应用替用户完成任务;Eazo 希望让已经被理解的需求直接长成一个独立的软件,保存下来,下一次无需重新对话。
Eazo 因此把 Agent 的接管范围继续向产品链条上游延伸。第一步不要求用户提前写出完整 PRD,而是先从一句相对粗糙的愿望里确认产品边界、补足关键条件,并把目标用户、核心流程和第一版范围逐渐收敛下来。
接下来进入视觉决策。Wild Design 会提供多套明显不同的设计方向;当前公开流程中,未指定数量时默认生成六个。用户未必能够准确描述信息密度、材质感和页面结构,却通常能够快速判断哪一种结果最接近自己的预期。

第三步是工程闭环。方向确定后,页面、数据持久化、登录、文件上传、AI、支付、第三方服务和发布继续进入同一条工作流。产品、视觉和工程被压缩到从意图到交付的一条链路里。
因此,这套英语学习工具更像一套完整生产过程的缩影:一个只属于个人的模糊需求,最终获得产品结构、视觉形态和工程能力,成为可以持续保存状态、反复打开和分享的软件。
上一轮 AI Coding 大幅降低了专业开发者生产代码的成本;生成型 Personal Agent 则试图把这种变化继续向非程序员扩散。当产品判断、设计选择和工程交付也被逐渐封装进 Agent,“会不会写代码”便不再天然决定一个人有没有资格生产软件。
下一批数量最大的“软件开发者”,很可能根本不会把自己视为开发者。他们只是刚好有一个过去不值得专门开发、今天却可以直接变成软件的需求。

从代码正确到软件交付:Eazo 如何定义“完成”
AI Coding 已经进入 Benchmark 极度密集的阶段。模型可以在 SWE-bench 上修复 Issue,在算法题、终端操作和代码生成上不断刷新数字。但当最终交付物从代码变成可以直接打开的软件,“完成”的定义也会后移:代码正确之外,页面完整度、素材接入、运行检查、错误恢复和最终部署都进入评测范围。
Eazo Benchmark v3.0 正是按照这条边界设计。整个 Benchmark 包含 147 个 entries,其中 103 个任务构成与 Codex CLI 可以直接比较的 comparable set。任务覆盖输入理解、设计深度、素材接入、运行检查、错误恢复与最终部署,同时引入 3D 模型、视频、数据库、字体和 Figma 文件等真实资产。

在这 103 个可比任务中,Eazo V5 的平均综合质量得分为 88.0,Codex CLI 为 84.4;七个能力维度中,Eazo 在六项领先,Codex 在一项领先。

Benchmark:https://eazo.ai/benchmark
这套 Benchmark 由 Eazo 自建,目标也非常明确:衡量端到端应用创作,而非重新定义一张通用 Coding 排行榜。它更值得观察的是评测终点的变化:对于 Coding Agent,通过测试的代码往往已经接近任务完成;对于软件生成 Agent,代码只是中间环节,页面能否实际运行、数据库能否保存状态、素材有没有正确挂载、错误出现后能否恢复,都会影响最终交付。
要完成这样一条更长的链路,单次模型调用显然不够。Eazo Tack 因此采用分层的多智能体与工具协同结构,目前包含 15 个原子工具和 1 个元工具,把视觉生成、图片处理、3D 资产、Shell、浏览器校验和部署等能力拆开,再根据不同任务动态组织。复杂 App 中可以并行的步骤被同时推进,存在依赖关系的步骤则按状态继续衔接。

Agent 与工作区处在同一沙箱,使运行错误能够重新进入推理链;Visual E2E 则在代码生成之后真正打开浏览器检查页面,把视觉和交互结果也重新纳入系统闭环,让“页面实际呈现是否正确”成为工程验证的一部分。与此同时,任务推荐 Agent 还会根据当前工程状态继续提出下一步可执行的迭代建议,使 Agent 不必在每一个阶段重新等待用户拆解工程任务。
效率指标也体现了这种系统化优化的方向。Eazo 给出的运行数据中,Tack 过去 7 日的全网缓存命中率达到 98.3%,综合使用成本约为 Codex 的三分之一。这里被压缩的不只是某一次推理调用的价格,而是复杂任务中重复计算、工具调度和上下文复用带来的整体工程成本。
基础模型的 Coding 能力持续接近之后,生成型 Personal Agent 的差异化空间正在向模型之外扩展:能否把模糊需求稳定转化成完整产品,并在长链路执行中维持状态、处理失败、完成交付,正在成为更直接的产品竞争力。

Personal Agent 的运行底座:身份、行动与记忆
一个随时为用户生成 App 的界面只是表象,更底层的问题是:当 Personal Agent 从一次性的任务执行器变成一个长期代表用户行动的数字主体,身份、权限、行动和记忆要能跨越一次次任务持续存在。
Eazo 背后的基础设施 Qoni 把这一层拆成三个基础能力:Identity、Action、Memory,对应 GenAuth、Web Agent 与 GUMem。它不参与底层模型竞争,而是位于模型和 Web、SaaS 等真实执行环境之间,让不同模型构建的 Agent 都可以复用同一套身份、授权、行动和记忆能力。

Identity 首先解决的是代理关系本身。一个 Agent 即使拥有自己的邮箱和电话号码,也不意味着它天然拥有合法的数字身份。真正需要被系统回答的是:这个 Agent 代表谁,它拥有哪些权限,权限可以持续多久,是否能够被撤销,以及某一次操作最终应当归责于谁。
在 Qoni 的 Identity 层里,GenAuth 把 Agent 与真实用户建立绑定关系,再把人的权限转化为有范围、有限时效、可以撤销的授权。一个用户拥有十项权限,并不意味着替他工作的 Agent 自动获得十项;Agent 可以只拿到完成当前任务所需的一部分,同时每一次操作留下可追溯的记录。对于逐渐进入企业 SaaS、账户乃至交易环节的 Personal Agent,这种权限边界直接决定了它能否从 Demo 进入真正的生产环境。
Action 处理的是执行环境。Web Agent 让 Agent 在托管浏览器中完成搜索、登录、点击、填写和提交,也可以把持续监控或定时任务留在云端运行。复杂任务还可以被拆成不同执行单元,在多个网站和 SaaS 之间同时推进。至此,模型输出的不再只是一段建议,而能够直接改变真实系统里的状态。
Memory 则决定一个 Personal Agent 能否在长期使用中保持连续。GUMem 同时接收对话和行为记录,再沿着 Action Logs、Fact、Summary、Topic 等层级整理长期记忆;这些记录可以被追溯、修改和删除。在 LoCoMo 长对话记忆评测的对应口径下,GUMem 达到 92.9%。
这一能力的商业价值并不难理解。一个每天都在使用的 Personal Agent,不可能每隔一个 Session 就重新询问用户的偏好、家庭关系和过去已经完成的操作。随着 Agent 开始承担持续数周甚至数年的事务,记忆质量直接影响服务连续性、个性化程度以及后续行动的准确性。
前端和底层由此形成了更清楚的分工:Eazo 负责把具体需求产品化,让用户获得可以看见、可以操作、可以分享的软件;Qoni 负责把身份、行动和记忆沉到公共基础设施层,使开发者不必为每一个新的 Personal Agent 重复建设相同的底层系统。
这也让一个二十多年前的互联网构想重新具有现实感。
2001 年,Tim Berners-Lee、James Hendler 和 Ora Lassila 在《Scientific American》发表《The Semantic Web》。文章开头没有谈协议,而是写了一个生活场景:Lucy 的母亲需要接受物理治疗,她把要求交给自己的软件 Agent;Agent 去读取治疗信息、保险范围和医生时间,再和弟弟 Pete 的日程协调,最后自动找出可以预约的诊所。
二十五年前,Semantic Web 希望把 Web 变成机器能够理解和协作的结构化世界;今天,大模型选择了另一条技术路径,直接从海量非结构化信息中获得理解能力。理解问题正在被快速解决之后,身份、权限、执行环境和长期记忆反而成为 Agentic Web 更具体的工程约束。Qoni 所做的工作,正落在这一层。

前台的软件界面可以不断生成、变化甚至消失,后台的用户身份、授权边界、执行能力和长期状态则需要持续存在。对于 Personal Agent 来说,这种连续性比某一个具体 App 的生命周期更重要。

Personal Agent 的 Macintosh 时刻
个人计算过去四十年的一个核心方向,是把越来越复杂的计算能力,以越来越简单的方式交到普通人手里。今天的 Personal Agent,正在把这种变化进一步推进到软件生产本身。
1984 年 Macintosh 留下的长期影响,并不只是把命令行换成了更漂亮的窗口。更重要的是,它把原本属于专业用户的计算能力,重新组织成图标、窗口、菜单和鼠标。普通人不需要知道底层命令,也可以直接进入计算机世界。

1984 年 Macintosh 实物照片。摄影:Sailko / Wikimedia Commons,CC BY 3.0。
此后的软件工业形成了另一套默认秩序:专业团队设计一套界面,再复制给数十万、数百万用户。GUI 降低了使用软件的门槛,却没有真正降低生产软件的门槛。
AI 开始改变后一个条件。自然语言让用户能够直接表达需求,Agent 再把产品结构、视觉、代码、数据和部署组织起来。过去必须由专业团队预先设计、再大规模分发的 GUI,因此第一次具备了围绕具体个人和具体场景即时生产的可能。
这会带来一条新的软件长尾。Airbnb、Amazon、微信这样的标准化平台仍然会长期存在,大规模通用需求依然需要稳定、成熟的产品。但在这些超级 App 覆盖不到的区域,软件正在获得更小的成立单位:一个家庭的特殊账本、孩子半年时间里使用的学习工具,或者一只宠物康复期间的健康记录。
这些产品不必服务十万人,也不必运行十年。它们只需要在一个具体周期里足够有用。随着生产成本下降,过去只能被塞进 Excel、备忘录和微信群里的零散需求,都可能获得真正的软件形态。软件成立的边界,正在从“有多少人拥有同一个需求”,延伸到“这个需求是否值得被解决”。
而真正的 Personal Agent 还要再往前一步。它不仅需要为一个人生成界面,也需要知道这个人是谁,知道自己可以替他做到哪一步,并记住过去已经发生的事情。第二天打开时,它不能又变回一个陌生的 Chat Session。
到了那个阶段,用户真正看到的东西也许反而会越来越简单。一个一岁半的孩子不需要知道背后跑着什么模型,更不会学习 Prompt Engineering,他只需要看到几张自己能够点懂的卡片。
这恰恰可能是消费级 Personal Agent 成熟之后最自然的状态:模型负责理解模糊意图,Agent 负责完成复杂规划和工程,身份、权限与记忆在后台维持长期连续性;所有复杂能力最终被压缩到用户真正需要的那一步交互里。
界面因此没有因为 AI 变得多余。相反,当每个人都能够要求一套属于自己的软件,界面第一次真正获得了“Personal”的含义。AI 未必会终结 GUI,它更可能终结的,是所有人必须使用同一套 GUI 的时代。









