Token导航 LogoToken导航TokenDH.com

易鑫解码“Human-Centric Long Horizon Agent”:企业级Agent最难的不是完成任务,是理解人

更新时间 2026-09-17来源 钛媒体正文 4846字阅读约 16分钟1 张图片

易鑫首席AI科学家、高级副总裁张磊

易鑫首席AI科学家、高级副总裁张磊

“对Agent来说,完成一件事可能不是最难的,最难的是怎么理解人。”说这话的是易鑫首席AI科学家、高级副总裁张磊。他所在的公司,做的正是这门“最难”的生意——汽车金融。

一笔汽车融资申请,要经过材料提交、审批决策、方案匹配、交付签约、资产管理五个大环节。仅材料就有60多种,审批决策涉及多达 15 个组织节点,路径组合上万种。而且这条链路不是线性走完的,任何一个节点,都可能回跳到前面任意一个节点。

这让大多数Agent在这里“过早收工”。张磊举了个例子:一个用户第一天进来,第三天补充资料,第七天额度发生变化、走了审批;到第十天,所有方案都试过了,没有适合他的。常规Agent到这里就会说,“我的任务结束了”。但真正的Agent会在第80天回头,那时公司接入了新的资方、有了新的产品,它会重新找到这个客户:“你还有没有相应的需求?我现在有东西可以满足你。”

一笔业务的成败,就分在第十天和第八十天之间。

也正因此,张磊对眼下衡量Agent的主流标准并不买账。行业里判断一个Agent厉不厉害,常说的是它能不能无干扰地跑完 100 步,能不能写出复杂的软件,或者操作几十页的网页逻辑。“但在企业应用里,更重要的是:给定一个业务目标之后,你能不能持续面对一个不断变化的人做交互,最终推动出一个业务结果。”

为此,易鑫提出了一套自己的范式——Human-Centric Long-Horizon Agent,即“以人为中心的长程智能体”。它由人的理解模型、垂直领域模型和Harness三部分组成,Harness又分三层:数据的Harness、Agent的Harness、人的Harness。前两者解决“懂人”,后者解决“能不能长期稳定地跑”。在张磊看来,让Agent出结果并不难,难的是它怎么长期稳定运行,这才是Harness在企业的价值。张磊透露,这套Harness框架计划在年底开源。

不过,他并不认为Agent应该包办一切。在易鑫的框架里,人的位置被明确保留:合规熔断(模型幻觉触碰强监管规则)、重大权益(比如罚息减免)、特批这类意外场景,三类必须转人工。

目前这套系统在线上的运转情况是45个Agent,日均处理任务约23 万次,每天消耗约3.6亿Token;AI能独立跟进同一个用户超过 20 天,单个任务执行超过16小时,单次对话超过81轮,且横跨企业微信、微信等渠道。

以下是易鑫首席AI科学家、高级副总裁张磊的发言速记,略经笔者编辑:

各位嘉宾下午好!我是来自易鑫的张磊,今天分享的主题是“工具到原生,汽车金融全链路的Agent革命”。

过去我们讲Agent,更多讲的是它够不够智能、能不能更智能地调用工具、完成各式各样的任务。但在实际的行业应用里我们发现,对 Agent来说最难的其实是理解人,因为它面对的是不断变化的人。所以怎么理解人、怎么影响人,以及最终怎么拿到业务结果,我认为这才是产业落地中更关键的能力。

接下来的分享主要是我们在这方面的思考。先简单介绍一下公司:易鑫是一家AI驱动的金融平台,有12年的行业积累,研发上也一直在大举投入。我们是整个汽车金融领域里第一家开源行业模型的公司,也是行业里第一家通过国家大模型备案的公司。同时我们跟开源社区有比较好的合作,近期把底层的GPU虚拟化工作也开源到社区了。在去年“直通乌镇”全球互联网大赛的开源赛道里,我们拿下了唯一的一等奖。

对汽车金融来说,为什么需要Agent?核心本质上是因为汽车金融是一个长链路、决策复杂、动态决策、强合规,以及结果导向的业务。可以看到,当一个用户进来,他会流过大概五个大环节,材料提交、审批决策、方案匹配、交付签约,然后是资产管理。每个环节里都会有很多子流程,比如材料提交涉及60多种材料,还要根据不同的场景去做组合。

审批决策里有15个组织节点,整个决策路径的组合大概有上万种。而且整个链路不是从左到右线性顺序执行的,左边的任何一个节点,都有可能回跳到前面的任何一个节点。所以这个过程没办法像传统 Agent那样,用流程自动化去解决。

所以在这样的场景下,就急需新型的Agent去解决这些问题。为此我们提出了一个新的AI范式,叫Human-Centric Long-Horizon Agent。这个范式主要有三个部分,第一部分是人的理解模型,第二部分是垂直领域模型,最后一部分就是常说的 Harness,我们把它分成了三层,数据的Harness、Agent的Harness和人的Harness。

为什么需要这三个组成部分?核心原因在于:当Agent具备工具能力的时候,它可以很好地完成任务;当它懂行业的时候,就能很好地完成业务任务。而当你以人为核心服务对象的时候,整个系统、整个 Agent就应该更懂人。你要知道人在想什么,才有可能更好地服务用户。所以我们认为,接下来尤其在企业Agent领域,会逐步过渡:更好地理解人,才是提升Agent效果的关键。

对Agent来说,完成一件事可能不是最难的,最难的是怎么理解人。围绕人的整个过程中,传统系统更多是在记录已经过去、已经结束的事情。比如一个人提交了融资审批,他当下的状态是什么,传统系统更多是在记录这种完成的状态。

但实际上,如果你想很好地服务人,就必须知道这个人接下来的状态是什么:他是不是有购车意向,他是不是信任你。整个过程是在环境不断变化中同时交互,同时对这个人的状态和行为做预测。

所以我们基于这套想法做了一个模型出来。它本质上是一个随机过程,输入是整体的语言环境和行为信号,输出是人的行为接下来应该如何变化、他的状态是什么样。

相比传统的Agent,它做的是管理建模,我们更多是在人的状态粒度上做建模。这意味着,人的状态不是一个静态的用户画像,而是一个随着交互和环境变化持续变化的状态建模,一种持续性的建模。

其实现在行业里谈Long-Horizon,包括大家去判断一个Agent到底厉不厉害,经常会说它能不能无干扰地完成一个比如100步的任务,能不能写一些复杂的软件,或者操作几十页的网页逻辑。

但在企业应用里,我觉得可能更重要的是:给定一个业务目标之后,我们能不能持续面对一个不断变化的人去做交互,最终推动出一个业务结果。

这里以汽车金融为例,一个用户第一天进来,第三天他可能到了补充资料的阶段,第七天他的额度发生变化,走了审批决策;到第十天发现所有方案都尝试过了,但没有适合他的。这时候常规的Agent可能就会说,“我的任务结束了”。但真正意义上的Agent,会比如在到了第80天的时候,因为我们接入了新的资方、有了新的金融产品,反过来去找这个客户,“你还有没有相应的需求?我现在有东西可以满足你。”

另外,当用户到了第480天、合同快要结束的时候,AI 会主动去做这种访客营销。整个决策的过程中,每一个节点其实都是由Agent独立承担的,但所有Agent背后其实是同一套程序运行循环的机制在支撑:目标拆解、规划决策、执行、观察反馈、交互,以及持续推进,它会变成一个大的闭环。

同时,对Agent model来说,很重要的一个内化能力叫Persuasion Policy,它能够动态决定我到底在什么时间去跟进这个用户、我应该说什么、不应该说什么、在什么渠道先跟他讲。所以整体它是以最大化长期转化为目标的。它的目标不是一次对话有多好,所谓最大化长期转化,对应的其实就是业务结果——我优化的是最终的业务结果。

举个例子,比如这里的预约率、到店率、成交率、渗透率等等。所以我们认为,这可能才是企业真正需要的Long-Horizon。前面有了model、有了Agent,为什么还需要Harness?我们的任务是说,企业里面真正要去运转AI Agent这件事,能不能出结果,我觉得是很容易的;但最难的是它怎么能够长期稳定地运行,这就是Harness在企业里的价值。跟传统的Agent相比,我们不太一样的地方在于,我们会基于用户的关系去做建模,这里面包括五大板块。

第一个板块是管理,它回答的主要是“发生了什么”。举个例子,我在9月份提交了30万的融资申请。第二部分是“正在发生什么”,这个用户中间还差一份资料没有补齐。第三部分是Agent怎么看待这个用户、这个客户,这块的上下文主要由model提供。比如客户购车意图的概率大概是70%,但他对月供的敏感度概率是 90%。这就是这一块要做的事。

第四是目标管理。其实每一个子阶段都会有一个相应的目标,我要去推动这个目标往前走。还以刚才的客户为例,这个阶段的目标可能就是完成“进店提报”。最后一个板块是,知道所有信息之后,我接下来要怎么办?同样以刚才的客户为例,接下来的动作应该是打消用户对月供的疑虑。

同时,在企业落地的过程中,逻辑上并不是所有角色都能交给AI去做,这里面有三个典型的场景。

第一个场景是合规熔断。比如大模型因为幻觉,出现了一些触碰强监管规则的内容,或者跟用户对话的过程中,用户产生了一些触碰规则的事件,这个时候就要迅速转人工。

第二种是涉及重大权益的,比如某一个单子需要做罚息减免,这个时候可能就要转到人去做判断;再比如一些意外的场景,比如特批流程,也需要转到人。

所以在Harness框架下面,其实是融合了Agent自己以及人本身。同时我们也会有相应的RSI这一套逻辑机制。在这个管理过程中,我们会形成相应的、用于训练模型的数据轨迹,这个轨迹未来会有一个小循环或者大循环去做优化,小循环主要是skill粒度的优化,大循环主要是基于model去做优化。

我们认为Harness框架本质上就是一个持续运行、持续反馈、持续优化的过程。我们计划在年底的时候,把这套框架开源出来。

综合以上讲的内容,我大概做一个总结,对比一下到底有什么区别。前者主要是在优化任务的执行,以及执行过程中怎么做规划和推理、怎么做工具的编排、怎么去完成它的一个flow,最终成没成功,这件事取决于任务是否完成,完成了就代表成功。

后者主要是在优化人的决策过程。除了要持久化用户的记忆,还需要对用户做信任和意图的建模,需要去做关系的管理。最终你成没成功,其实在于你有没有产生收益、有没有转化成功。所以本质上我们认为,未来AI Agent在企业的应用,会从任务的执行过渡到Harness。

这个是我们实际运转中的应用效果。目前在线上一共有45个Agent在跑,日均处理任务大概23万次,每天大概消耗3.6亿Token。因为我们整个集团有自己的训推一体化平台,所以整个model都是在这个平台上跑的。

Agent的自主交付率现在达到 90%,整体的运营提效大概是45.4%,线索从接触到成交平均大概3天。AI现在可以独立地跟进同一个用户超过 20 天,单个任务的执行时长超过16个小时,单次对话超过81轮——这些对话可能发生在企业微信,也可能发生在微信,是一个跨渠道的逻辑,全程的信息交互大概超过了400条。同时我们也有商业化的产品,是一站式的AI智能服务解决方案。

目前有三个大的核心板块,一个是做智能硬件,鑫灵盾是做风控的决策系统,鑫智管是做资管的服务系统。然后底层Model是我们自己的一套新的推理模型,以及整个新系列不同尺寸的Model。

在整个应用的规模上,产品应用上大概累计有1.44亿次的使用,覆盖了智能呼叫(每天10万通)、智能辨识、智能审批、客服、资管、质检等,基本上覆盖了整个行业的所有场景。

除了提供技术方案之外,我们也有生态合作伙伴,这里面包括 80 家以上的互联网企业、100多家主机厂、100多家金融机构,以及4万多家经销商。

最后我想分享一下今天的核心观点。我们认为,未来企业Agent的AI进化会逐步过渡,整个模式可能不只是适用于汽车金融这个行业,也适用于所有类似的、需要交付业务结果的场景。谢谢大家!(本文首发钛媒体APP,文 | 智客Zhiker,作者|郭虹妘,编辑|杨林)

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多