豆包手机二代发布了,新机搭载豆包手机助手消费者版,主打全新AI交互体验,具备听得懂、能干活、记得住、够安全四大核心能力。
经媒体实测,现阶段用语音操作Agent,优先覆盖字节跳动旗下产品,可调用字节全系列产品,但美团、小红书、淘宝闪购、京东等外部APP暂不支持相关操作;此外,部分此前能够通过GUI(图形用户界面)自动操作的App,已无法自动操作。

豆包手机助手团队在用户群里表示,目前正在推进屏幕自动化操作声明协议的适配工作,过渡期间部分应用会临时无法使用自动操作能力。
记得豆包手机一代发布的时候,让人倍感惊艳,但同时也遭受隐私安全方面的非议。
豆包吃了闭门羹,该不该背“外挂”的锅?
它被一系列主流APP和金融类APP集体拉黑。因为它触发了微信、支付宝等涉及支付、金融场景App的严格风控,它们优先选择“宁可错杀”来保障资金安全。
核心是豆包助手没经过授权,或者经过了用户授权,但没经过APP的授权。
第二代如何解决这个问题?据悉,豆包这次推出了SAEP(屏幕自动化操作声明协议),并设置了30天公示期。

根据协议,第三方应用可以自主声明是否允许AI助手执行屏幕自动化,也可以限制具体操作。
30天公示期内:应用在公示期内不会被GUI智能体操作,除非主动声明接受;
公示期满:若未通过邮件告知且未通过SAEP协议声明拒绝,将开放GUI智能体操作应用的能力。
如果不希望智能体操作应用,可以通过两种方式随时声明拒绝,长期有效。

协议还附了个表单。
总之就是,公示期满后,你什么都没操作,没发邮件拒绝,默认就可以让豆包助手访问操作;你想拒绝,就需要自己主动发邮件或通过协议声明拒绝。
今天就讨论一下这个机制。
一代的账,还没翻篇
一代的争议,表面看,是一场“没打招呼就进门”的礼仪风波;往深一层看,它动摇的是移动互联网十几年攒下来的底层信任结构。
支付和社交类App的风控体系,建立在一条隐含的公理上。屏幕上的每一次点击,背后都是一个能被归因的人。设备指纹、行为序列、操作节奏,所有模型都在验证这次操作是不是本人在做。
豆包手机一代用读屏加模拟点击的方式接管操作,等于在这条公理上撬了一道缝——操作是真的,人却不在场,归因链条断了。建行、农行、微信、支付宝在发售后两三天内集体启动风控,并非反应过度,它们除了“宁可错杀”没有别的选项。在归因链条修复之前,每一次模拟点击都是潜在的不可追责操作。
这个背景很重要,因为它决定了二代的SAEP不能只是态度修正,而应该是结构修复。
结构修复的正解,是把断裂的归因链条重新接上。让App知道谁在操作、以什么身份、依据什么授权。这是行业后来一系列文件的共识底座:中国软件行业协会的标准要求智能体以可识别、可验证的方式声明身份;《端云协同 智能体交互双重授权安全指引》明令不得伪装用户主体。
而豆包交出来的答案,是另一回事。
默认值,重写了权力关系
SAEP的核心机制,值得逐字读一遍:公示期内不主动声明接受就不开放;公示期满,不主动声明拒绝就开放。
同一个“主动声明”,在两个时间点指向了相反的方向。这意味着决定绝大多数应用命运的,不是评估、不是协商,而是默认值。
默认值向来不是中立的。行为经济学里有个经典发现:器官捐献率在“默认同意、可退出”的国家超过九成,在“默认不同意、可加入”的国家只有百分之几。不是两国人民对生命的态度差了十倍,只是表格第一栏的勾选位置不同。谁设定默认,谁就赢下了所有沉默者。
豆包把默认值拨向“开放”,就把一张覆盖全行业的通行证,建立在开发者“不作为”之上。举证责任完成了一次彻底的搬家:一代模式下,智能体方必须先证明“我拿到了授权”才能动手;二代模式下,应用方必须证明“我拒绝过”才能幸免。前者的成本由拥有millions用户的一方承担,后者的成本由可能只有几千用户的一方承担。
这是权力关系的重写,而非授权制度的优化。
这30天对不同体量的玩家,意义也不同。
对主流App厂商而言,它们有标准团队盯着每一份行业协议,有法务评估合规风险,有市场渠道对接,30天绰绰有余;
对一个三五人的小团队,30天是一次信息突袭。他们大概率不知道什么SAEP,不知道倒计时已经开始;应用后台的客服邮箱可能半年没人看;就算知道了,读懂协议里“限制具体操作”的声明边界、评估开放GUI读屏对自家数据的影响,也远超他们的专业储备。30天后,他们的应用也许在毫不知情的状态下被纳入了一个巨头的自动化版图。
好在,可以事后随时拒绝。但,这个注意力成本、拒绝成本还是得小团队承担。
opt-out机制(选择退出,你不反对我就动)最讽刺的地方就在这:它把“不作为”设计成了授权。而恰恰是不作为能力最弱的那批开发者,最容易被不作为埋进去。
行业的共识,是双重授权
那到底该怎么获得授权?其实行业是有共识的。
2025年4月,中国软件行业协会发布团体标准,明确写进“双重授权”原则:先获得第三方App授权,再叠加用户授权,缺一不可。
2025年12月,《端云协同 智能体交互双重授权安全指引》发布,要求智能体访问第三方应用前应遵循双重授权原则,应以可识别、可验证方式声明身份,不得以伪装用户主体的方式实施访问。
2026年8月,首个金融领域智能体安全团体标准落地:未经金融机构授权,不得自动化操作金融App的GUI界面。
放眼海外,谷歌的AppFunctions、苹果的App Intents、微软的Copilot插件,清一色 opt-in(选择加入,默认不调用):开发者不声明,智能体就不碰。
也就是说,从监管标准、行业自律到头部实践,多个层面给出的答案高度一致:智能体进别人家门,得先敲门,而且主人得在家、得答应。
写在最后
从一代到二代,豆包的野心没有收缩半分,GUI自动操作照样做,只是把“先斩后奏”升级成了“沉默即同意”——反对的成本挪到了别人身上。
智能体是比以往任何入口都大的入口。它接管的不只是流量分发,而是操作本身。当一部手机可以替你点外卖、转账、发消息,谁有权定义这套能力覆盖谁,就不再是产品问题,而是基础设施问题。
健康的智能体生态,需要一步步把接口开放标准、权限申请逻辑、数据保护边界摆到台面上,是需要和整个生态里的玩家共同协商出来的。







