Token导航 LogoToken导航

AI替你行动后传统界面形态正在改变

更新时间 2026-10-02来源 虎嗅网正文 9479字阅读约 30分钟1 张图片

Meta Muse、OpenAI Dots、Microsoft Project Solara等Agent产品开启人机交互新范式

本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《当 AI 开始替你行动,界面开始不再像界面》

过去几十年,计算机界面一直在解决同一件事:

人怎样操作机器。

你打开App,找到功能,点击按钮,输入参数,确认执行。

你知道文件在哪,知道功能在哪,知道哪一步该由自己完成。

但2026年开始,很多新产品正在把这个前提一点点拿掉。

Meta Muse、OpenAI Dots、Microsoft Project Solara,以及一批企业Agent产品,表面上看依然有聊天框、卡片、侧边栏和设置页;但它们共同在做的事情,已经不是“给Chatbot找一个更漂亮的UI”。

它们开始让机器在你离开之后,继续替你行动。

OpenAI对Dots的描述非常直接:它是一个可承担持续责任、拥有云电脑、可跨连接应用工作的常驻Agent;Meta Muse也把长期目标、后台行动、跨应用执行和权限控制放进了同一个产品定义里。

这意味着,未来人机交互最重要的问题,是:

“机器什么时候可以替我行动?”

“它能做到哪里?”

“它凭什么这样做?”

“什么时候必须回来找我?”

“如果它做错了,我怎样把权力拿回来?”

这不是简单地UI风格的变化,这是计算机第一次开始把“执行权”从界面里抽走。

而未来界面的任务,也会从“让人操作机器”,变成“让人委托、限制、监督并收回机器的行动权”。

一、未来的电脑首页,可能只剩三件事

想象一下,几年后的某个早晨。

你打开电脑。

它不再先给你二十个App图标,不再先给你几百封邮件,也不一定先给你一个空白聊天框。

它可能只给你三类东西。

第一类:

我在替你推进什么。

“你的竞品研究正在进行,两个新的市场变化已经进入待判断状态。”

“客户流失预警已启动,有三位客户满足介入条件。”

“下周的商务出差已经完成初步安排,有一项航班选择需要你确认。”

第二类:

昨天什么发生了变化。

“竞争对手更新了定价策略,影响分析已生成。”

“项目预算减少10%,原计划中的两项工作被重新排序。”

“一个此前成立的研究假设,被新的数据推翻。”

第三类:

哪些地方必须由你决定。

“两个供应商都符合条件,但成本和交期存在取舍。”

“需要一次性付款2600美元,超过了当前授权上限。”

“任务看似完成,但系统无法确认订单是否真的提交成功。”

可以把它压缩成三个词:

Goals—Changes—Exceptions。

这看起来像一个更聪明的Dashboard仪表盘。

但它其实不是。

Dashboard的前提是:人看数据,再操作系统。

而这个新界面的前提是:机器已经在替人行动,人只在关键处重新出现。

这才是Agent Interface和传统软件界面的根本差别。

二、2026年发生的,不是Chatbot找到了下一种皮肤

如果只看视觉,这一轮变化很容易被低估。

还是输入框,还是聊天记录,还是文件上传,还是侧边栏。

但底层交互的基本单位,已经开始移动。

过去是:Message

你问一句,机器答一句。

接着是:Task

你不再问“这个行业最近有什么新闻”,而是说“帮我把这个行业过去三个月的重要变化理一遍”。

机器会自己搜索、筛选、调用工具、保存中间状态、整合信息,然后过一段时间把结果交回来。

再往前一步,正在出现的是:Responsibility责任

不是:“帮我查一下今天发生了什么。”

而是:

“持续关注这个领域,真正重要的变化出现时告诉我。”

不是:“整理今天的邮件。”

而是:

“管理我的收件箱,只把我必须亲自处理的事交给我。”

这三者的差异,不只是任务长度。

过去正在发生更远的未来
MessageTaskResponsibility
SessionProjectRelationship
操作委托长期授权
AppCapabilityAgent-managed world

Task会结束。

Responsibility不会。

Task的状态是Done。

Responsibility的状态更接近:

Active、Suspended、Escalated、Revoked。启用、暂停、升级、撤销。

这也是常驻Agent最重要的变化。

它开始拥有长期目标、工作历史、权限边界、事件订阅、世界状态和待履行的职责。

于是,真正重要的问题变成:

  • 它现在负责什么?

  • 它承诺了什么?

  • 它在等待什么事件?

  • 它拥有什么权限?

  • 它做了哪些动作?

  • 它在什么情况下必须回来找我?

  • 我怎样暂停它、收回它的权限,或者把它交给另一个人管理?

这已经不像在使用一个软件功能。

更像是在管理一个被长期委托的数字角色。

三、执行权正在离开界面

传统GUI的伟大之处,在于它把机器的复杂功能,变成了人可以逐步操作的对象。

窗口、菜单、文件夹、按钮、鼠标指针,本质上都在回答一个问题:

我怎样让计算机完成这件事?

路径通常是这样的:

打开App→找到功能→点击按钮→填写参数→确认执行→看结果

这套路径的前提是:人负责导航、选择、执行和确认。

但Agent正在把其中越来越多的环节接过去。

未来的路径会逐渐变成:

表达结果→系统理解意图→Agent选择工具与路径→机器行动→人只在关键处介入

微软Project Solara对这轮变化的表达很激进:从“打开的软件”走向“被调用的智能”,从按钮和图形界面走向意图表达,设备则成为进入长期运行智能的窗口。它提出的“just-in-time UI”,本质上是在设想:同一个Agent可以根据设备、上下文和交互方式,临时生成适合此刻的界面。

这意味着,最先消失的可能不是屏幕,而是mode selection模式选择。

今天的用户还常常需要判断:

  • 我现在应该搜索,还是问Chat?

  • 应该开Deep Research,还是开浏览器?

  • 应该调用Agent,还是自己操作网页?

  • 应该进入哪一个App?

  • 应该选择哪一种工作流?

未来这些选择会越来越多地变成系统内部的问题。

人表达Outcome结果,机器决定Execution执行。

与此同时,App不会真正消失。

它会从过去的“人类导航单位”,逐渐降级成未来的“机器能力容器”。

过去是:人知道功能藏在哪个App。

未来是:Agent知道哪个App、工具、网站、协议、模型或服务可以完成这件事。

这不是App消失。

而是App从前台入口,退到后台能力层。

四、人类没有失去控制权,只是控制权换了位置

当机器开始接管执行,最自然的担忧是:

AI越强,人是不是越失去控制权?

这其实把“操作权”和“行动权”混在了一起。

传统GUI给人很强的过程控制。

点哪个菜单、打开哪个文件、选哪条路径、填写什么参数、执行哪个动作,都是人决定。

Agent拿走这些过程操作后,表面看,人类似乎失去了一部分控制。

但更准确的描述是:

人类的控制权,正在从“如何做”迁移到“要做什么、做到哪里、什么情况下必须停下来”。

过去,人控制:

  • 每一步操作;

  • 每一个菜单;

  • 每一次输入;

  • 每一个执行动作。

未来,人更可能控制:

  • 最终目标;

  • 可接受的代价;

  • 优先级;

  • 时间边界;

  • 金额边界;

  • 数据边界;

  • 对外沟通边界;

  • 例外处理规则;

  • 是否接受结果;

  • 是否继续授权。

以商务出差为例。

传统UI下,你需要:

打开订票App→搜索城市→选择日期→对比航班→看价格→填个人信息→确认支付。

Agent-native的表达可能是:

“按我过往的商务出差偏好处理。超过3000元、涉及改签风险、红眼航班或签证问题时再问我。”

前者是Control every step。

后者是Control policy and boundary。

人不再是亲自移动鼠标的人。

人开始变成Principal:定义目标、授予有限权力、处理价值冲突、接受最终结果的人。

这也是未来界面最深的一层变化:

Human agency不等于human operation。

人不必亲手操作每一步,仍然可以拥有结果、边界和责任。

五、反直觉:AI越强,界面未必越少

一种流行想象是:

AI越可靠

→人越不需要操作

→UI越少

→最终只剩语音,或一个聊天框。

这只说对了一半,人确实会越来越少参与连续执行。

但这不等于人应该什么都看不见。

因为如果Agent一天完成几千次动作,让人逐条看几千条日志,没有任何意义。

人不需要知道:

它点了哪个按钮。

它打开了哪个网页。

它复制了哪一段文字。

它调用了第几个工具。

人真正需要知道的是:

  • 它为什么相信这个结果;

  • 哪个假设发生了变化;

  • 哪个动作不可逆;

  • 哪个结果无法验证;

  • 它动用了什么权限;

  • 它为什么认为自己有资格这样做;

  • 它在哪里触及了默认规则的边界。

因此,未来UI既不会简单走向“更多透明”,也不会走向“完全黑箱”。

它会走向:

Just enough transparency恰到好处地透明

低风险、可逆、确定、短任务,UI可以越来越隐形。

高风险、不可逆、不确定、涉及真实价值取舍的任务,UI不但不能消失,反而会变得比今天更重要。

可以把未来交互写成一个简单函数:

Interface=f(Risk,Reversibility,Uncertainty,Duration)

它大致会导向几种不同制度:

  • 低风险、可逆、确定、短任务:Invisible Automation;

  • 风险略高:Act→Inform;

  • 涉及付款、对外沟通、重要修改:Prepare→Approve;

  • 高不确定性、创造性任务:Shared Workspace;

  • 长期、多Agent、高责任任务:Role/Policy/Exception UI。

所以,未来UI会从continuous interaction持续互动,变成selective intervention选择性干预。

平常,机器自动流过。

到了真正需要人类判断的地方,机器停下来。

六、未来界面真正要管理的,不是页面,而是行动权

如果一个Agent要替人行动,人和机器之间究竟需要被明确管理什么?

答案是一套新的关系对象。

1.Goal:人想让世界变成什么样

Goal不是一句Prompt。

Prompt是表达方式。

Goal才应该是持续存在的系统对象。

比如:

“完成一本关于AI时代技术品味的书。”

这个Goal下面,未来可能天然挂着:

  • Context;

  • 相关文件;

  • Research;

  • Deadline;

  • Budget;

  • Success criteria;

  • 当前状态;

  • Agents;

  • Decisions;

  • History;

  • Constraints。

它可能持续几个月,甚至几年。

你离开电脑之后,它依然存在。

所以,Goal很可能成为File、Folder、Project之上的新抽象。

因为文件终于开始被放进一个更接近人类意图的结构里。

2.Responsibility:谁长期负责这件事

Task是:

“查一下今天发生了什么。”

Responsibility是:

“持续关注这个领域,出现真正重要的变化时告诉我。”

Task是工作的分解单位。

Responsibility才是长期委托的单位。

这也是为什么“AI员工”这个词虽然粗糙,却抓到了一点什么:未来的关键不只是某个Agent能否做完任务,而是它是否拥有明确、持续、有限的职责域。

但“数字员工”仍然不够准确。

Agent不应该被赋予无限责任。

它应当是一个受限角色。

它有职责,也有权限边界;能主动行动,也必须接受暂停、撤权和接管。

3.State:我们共同面对的现实是什么

未来复杂协作的中心,是双方共同面对的State状态。

它可能是:

  • 代码库;

  • 文档;

  • 表格;

  • 设计稿;

  • 客户状态;

  • 供应链数据;

  • 订单;

  • 日程;

  • 数据集;

  • 研究资料;

  • 一个正在变化的世界模型。

所以未来复杂知识工作最稳定的形态,很可能不是Shared conversation。

而是:

Shared state共享状态

人和Agent围绕同一个Artifact工作。

聊天退到边缘,负责澄清、协商、批评、重定向。

真正的“共同事实”,存在于Artifact和State里,而不是聊天记录里。

AG-UI这类新协议之所以值得注意,因为它开始把Agent状态、UI intent、工具调用和用户交互视为同一条实时交互边界上的对象。

4.Trigger:机器什么时候可以主动行动

传统GUI的核心时间结构是:

now。

点击以后,现在执行。

常驻Agent的时间结构则是:

if/when/until。

  • 如果价格低于某个阈值;

  • 收到某个人的邮件时;

  • 如果项目三天没有进展;

  • 一旦竞品发布新产品;

  • 如果一个研究结论被新证据推翻;

  • 每周五生成一次简报;

  • 当客户流失风险达到某个等级时。

Trigger触发器不是高级版日程。

它是:

机器何时获得Initiative的条件。

没有Trigger,所谓“全天候Agent”大概率仍然只是一个后台Chatbot。

5.Authority:机器能做到哪里

传统软件权限问的是:

App能不能访问相机?

Agent世界的问题是:

这个Agent在什么条件下,可以代表我做什么?

这完全不是一个层级。

未来的授权会越来越像:

  • 可以读邮件,但不能发送;

  • 可以草拟合同,但不能签署;

  • 100美元以下的采购可以自行处理;

  • 公开发布必须人工确认;

  • 可以与供应商协商,但不能承诺价格;

  • 晚上十点以后,只有P0风险可以打扰;

  • 可以访问项目资料,但不能把数据带出组织边界。

过去软件有Settings。

Agent时代,越来越重要的对象会是:

Policy规则

Settings管理软件如何运行。

Policy管理机器可以代表谁行动、行动到什么程度。

Workday已经把Agent Interaction Policy作为独立安全对象,用来定义哪些用户可以调用哪些Agent技能。

这只是很早期的形态,但方向已经出现了。

6.Exception:机器在哪里必须把权力交还给人

Notification说的是:

Something happened。

Exception说的是:

Machine agency stops here.Human agency required.

这是完全不同的东西。

未来的Exception可能包括:

  • 两个方案都可行,但成本和时间存在不可自动化的取舍;

  • 付款超过预算;

  • 某个高风险动作需要扩大权限;

  • 先前成立的假设被新数据推翻;

  • 结果看似完成,但无法验证;

  • Agent遇到与既定目标冲突的新情况;

  • Agent无法继续推进,需要重新定义目标。

Exception是权力交接点。

也是未来Agent Inbox最值得关注的地方。

过去的Inbox是:别人希望我做什么。

未来的Inbox更可能是:

机器在哪些地方不能替我做决定。

7.Verification:我怎么知道它真的做对了

AI越强,人越不应该逐步盯着它做事。

人应该看证据。

未来最重要的迁移,可能是:

Reasoning visibility→Evidence visibility。

我们今天经常观看:Agent做了什么。

未来更重要的会是:有什么证据证明它做对了?

这会带来一批新对象:

  • Receipt;

  • Evidence;

  • Source;

  • Test;

  • Provenance;

  • Diff;

  • Outcome verification。

人不需要重读整个系统。

人需要知道:

它改了什么。

为什么改。

哪些地方仍然不确定。

什么证据支持它说“完成了”。

W3C最新的《Web User Agents》草案也已经把软件“代表用户行动”放到更严肃的位置:它把保护、诚实和忠诚视为user agent对用户的基本职责。这个草案,说明浏览器、助手和Agent正开始共享一种更本质的定义:它们不是单纯呈现信息的工具,而是代表用户与外部世界交涉的软件。

8.Recovery:如果不对,我怎样把权力拿回来

传统Ctrl+Z撤销的是:一次编辑。

Agent世界需要撤销的是:一条自主行动轨迹。

这可能意味着:

  • Pause;

  • Cancel;

  • Rollback;

  • Revoke;

  • Restore;

  • Fork;

  • Compensate。

你不只是撤销一封邮件,可能需要暂停整个持续责任,收回权限,恢复到某个检查点,取消后续计划,甚至要求系统对已经发生的动作做补偿。

所以Recovery恢复比Undo撤销更像Agent时代的基础能力。

行动能力越大,可恢复性越重要。

这不是因为模型不够聪明。

而是因为“替人行动”这件事本身,就要求人始终保有收回行动权的能力。

七、GUI之后,是一门新的交互语法

GUI时代,Window、Icon、Menu、Pointer的意义,在于它们把复杂计算函数,变成了用户可以理解和操作的对象。

Agent时代真正对应的,不太可能是一组新的视觉控件。

它更像一组新的关系原语:

Goal

Responsibility

State

Authority

Trigger

Exception

Verification

Recovery

以及一组新的动词:

Define

Delegate

Grant

Observe

Act

Escalate

Verify

Override

Revoke

Accept

把它们连起来,就得到一条新的交互语法:

人定义Goal。

人委托Responsibility。

人授予有限Authority。

Agent观察State。

Trigger激活行动。

Agent在边界内执行。

出现Exception时升级给人。

人做价值判断或重新定向。

Agent提供Verification。

人接受结果,或暂停、撤权、恢复。

注意,这里已经很少出现传统GUI的核心动词:

Click、Open、Scroll、Navigate、Launch app。

它们没有完全消失,但正在退到更底层。

GUI把机器的功能变成可操作对象;

Agent Interface要把机器的行动权变成可操作对象。

八、Chat、生成式UI、共享工作区和眼镜,不是在争同一个终局

今天关于未来界面的讨论,常常把很多不同层的东西混在一起。

Chat、Canvas、Generative UI、语音、眼镜、Agent OS、Shared Workspace,看上去都在竞争“下一代界面”。

其实它们解决的不是同一个问题。

1、Chat:未来的语言化控制通道

Chat不会消失。

它仍然是人表达模糊意图最自然的入口。

但它不太适合承载一切。

Chat更适合:

  • 发起委托;

  • 澄清目标;

  • 协商取舍;

  • 质疑结果;

  • 中断任务;

  • 重新定向;

  • 追问“为什么”;

  • Debug Agent的判断。

它更像:

语言化的Command Line+Negotiation Channel。

重要,但不等于整个操作系统。

2、Shared Workspace:复杂创造的真正中心

当人和Agent真正一起写代码、做研究、改文档、设计产品、分析数据时,最重要的并不是聊天记录。

而是共同操作的对象。

Conversation at the edge,Artifact at the center。

聊天负责协商。

Artifact承担共同事实。

这也是为什么未来所有界面不会都缩成一个输入框。

复杂工作必须有共同状态、结构化对象、差异视图、验证机制和可恢复历史。

3、Generative UI:把语义临时编译成最适合当前任务的界面

Generative UI很重要,但它解决的是:

这一刻,机器应该给人呈现什么操作表面?

同一个Exception,有时适合两个按钮。

有时适合一张比较表。

有时适合地图。

有时适合一段Diff。

有时适合一个模拟器。

Google A2UI的思路很有代表性:Agent不直接交付一张任意生成的网页,而是用结构化数据表达“应该渲染什么”,再由宿主应用用自己的组件系统生成界面。

这意味着:

UI开始从application property,变成runtime output。

但Generative UI不是终局。

它只是Presentation Layer的突破。

真正决定一张临时界面该长什么样的,是更底层的语义对象:这是授权、异常、验证、恢复,还是目标取舍。

所以:

Generative UI的终局不是没有原语的UI。

恰恰相反,它需要更稳定的语义原语,才能每次生成不同但正确的界面。

4、Ambient Interface:屏幕不会消失,它会变成信心表面

眼镜、耳机、戒指、手机、桌面设备,都可能成为Agent出现的入口。

低风险任务当然会越来越无界面化。

提醒、记录、导航、整理、环境感知,很多动作会在你没有主动打开软件时发生。

但这不意味着屏幕消失,更准确的描述是:

Screen将从execution surface,变成confidence surface。

平时,它不必出现。

当你需要比较、验证、授权、复盘、撤回或处理风险时,它出现。

不是为了让你操作机器。

而是为了让你确认自己仍掌握局面。

九、未来的桌面,不是App首页,而是注意力路由器

回到开头的三块未来首页。

经过前面的拆解,它们不再只是一个漂亮猜想。

它们是Agent-native计算最自然的结果。

1、What I care about

Goal/Responsibility目标/责任

什么在被持续推进。

什么被暂停。

什么需要重设边界。

什么长期由谁负责。

2、What has changed

State/Results/Verification状态/结果/验证

世界发生了什么变化。

Agent做了什么。

它留下了什么证据。

哪些结果已经验证,哪些仍然不确定。

3、What needs me

Exception/Decision/Authority request例外/决定/权限请求

哪些地方到了机器行动的边界。

哪些地方必须由人做价值判断。

哪些地方需要扩大、收回或修改授权。

这其实就是未来的Agent Inbox。

它不再是Email Inbox,是:

Human Attention Router人类注意力路由器。

当Agent足够多以后,人类最稀缺的资源不再是输入命令的能力。

而是注意力。

不是“怎样让机器开始做事”。

而是“在什么时刻,什么事情值得我亲自出现”。

十、多Agent时代,界面最终会像组织结构

如果未来一个人不再只拥有一个AI,而是拥有:

  • 研究Agent;

  • 编码Agent;

  • 日程Agent;

  • 财务Agent;

  • 招聘Agent;

  • 个人Agent;

  • 公司Agent;

  • 以及一群临时Subagents;

那么“和二十个Agent逐一聊天”,不可能成为稳定界面。

人也不会愿意观看二十个Agent的完整内部协作过程。

未来人真正需要管理的是:

  • Role;

  • Responsibility;

  • Authority;

  • Budget;

  • Policy;

  • Escalation;

  • Evidence;

  • Ownership。

这也是为什么Agent UI最后会越来越像Organization UI。

Salesforce已经在产品层面呈现了很早期的形态:一个任务可以同时分配给AI Agent与人类审核者,Agent先填充内容,再停下来等待人类审阅;无法完成时,也可以转交给预设的fallback assignee。

它说明,软件开始第一次以一种可委托、可约束、可追责的角色,进入组织结构。

过去的组织图只安排人和部门。

未来的组织图会开始安排:

  • 人;

  • Agent;

  • 工作流;

  • 权限;

  • 预算;

  • 审批;

  • 责任边界;

  • 例外升级路径。

十一、界面将成为人类意图、机器行动权与责任交接发生的地方

未来不会只有一种“AGI的iPhone界面”。

不会所有事情都变成Chat,不会所有屏幕都消失,不会所有任务都交给AI。

真正稳定下来的,是不同风险、不同责任、不同不确定性之下的几套交互制度。

低风险任务,自动化会隐形。

复杂创造,人和AI会共同编辑同一个世界状态。

高风险行动,会需要结构化授权、证据、验证和确认。

长期多Agent系统,会要求我们管理角色、责任、预算与升级路径。

所以,未来UI的问题不再是:“我怎样让机器做这件事?”

而是:

“我想让世界变成什么样?”

“谁来持续负责?”

“它可以做到哪里?”

“它什么时候可以自己行动?”

“什么情况下必须回来找我?”

“我怎样知道它做对了?”

“做错以后,我怎样把行动权拿回来?”

过去,界面让人学会操作机器。

接下来,界面要让人学会把机器的行动权交出去,又在必要时拿回来。

文章标签微软OpenAI智能体AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多