Token导航 LogoToken导航

开源客服AI决策模型Instinct解决自动执行难题

更新时间 2026-09-30来源 甲木未来派正文 5568字阅读约 18分钟13 张图片
INSTINCT · CUSTOMER SERVICE客服 AI,先把判断做对不写长答案,直接给出选项概率。开源项目 · 决策模型 · 企业落地REQUEST → DECISION → ACTION客户诉求 + 业务规则 + 候选答案Instinct · 做选择题高置信自动执行中置信执行 + 抽检低置信交给人工按业务风险设阈值,不确定的交给人

4 PARTS · CONTENT MAP

左右滑动

PART 01

客服难在判断

选项、成本与置信度

PART 02

模型做选择

Jev · Instinct · 开源

PART 03

怎样放心用

五类场景

PART 04

用自己数据试

试用、开源入口

大家好啊,我是甲木。

先祝大家国庆快乐!马上开启假期欢乐模式,先给大家在文末抽个假日小礼物,再给大家分享节前最后一篇内容~

最近 Jev 模型不是比较火吗?以“系统一”模型著称,用于决策处理非常地快,但用在「客服」场景中我觉得还是差点意思。。正好我又发现了一个宝藏开源项目——Instinct(直觉),同样的小模型,同样的“系统一”,专注企业 AI 客服场景,不得不分享给大家了,尽量打破一些信息差。

图片

从 24 年到现在做企业服务落地,「客服」是一个非常高频的通用场景,经常会接到不同客户对于这个场景的诉求。

图片

先来说说这个场景的痛点,

“转人工!转人工!转人工!”

我相信各位都说话这样的话。。大概也是客服机器人听到最多的一句话。

很多人以为,机器人挨骂是因为不会说话。但随着大模型发展,早已把话说得足够好了。

让用户崩溃的,往往是它判断错了。

用户说“耳机用了两天,左耳就没声了”,机器人回复“签收已超 7 天,不支持无理由退货”。可按规则,15 天内的质量问题本该直接换货。

用户第三次追问“到底什么时候发货”,语气已经在冒火,机器人还在礼貌地重复物流模板。

话说得再漂亮,判断错一次,就是一次投诉。

一轮普通的客服对话背后,系统要做十几次这样的判断。而目前行业里最常见的做法是:每做一次判断,就让大模型写一段 JSON。

这相当于让一位作家,用写作文的方式来答选择题。

刚才说的 Jev 这种思路正在硅谷走红:不让模型“写”答案,只让它给出每个选项的概率。Instinct 系列决策模型也是为了解决这个问题,由企业 AI 平台 ZooWork 近期推出,在客服场景中的落地尝试。

PART

01

为啥在 AI 客服场景中,判断很重要?

WHY DECISIONS MATTER

把一个成熟的客服系统拆开看,每一轮对话背后通常都有十几到几十个判断点。

用户想查物流、退换货、改地址、开发票,还是投诉?签收超过 7 天的商品能不能退,这位用户是否满足补偿条件?情绪到了什么程度,有没有提到“曝光”“起诉”?该让机器人继续,转给售后专员,还是升级给主管?刚才那句客服回复有没有越权承诺?下一步该查订单、发优惠券,还是建工单?

这些判断有一个共同点:答案来自一个有限的选项集合。

它其实只需要在几个选项里选一个,并且说清楚:有多确定。

图片

就这么一件事,在过去两年,行业里最常见的做法是:写一段提示词,让大模型输出 JSON,再解析结果。

能用。但一进生产环境,三个扎心问题就会反复出现。

(ps.相信做过企业客服落地场景的小伙伴都能感同身受。。)

第一,慢,而且贵。客服是高并发场景,一轮对话十几个判断,每个都要逐字生成一段文本,延迟和成本层层叠加。用户在等,账单在涨。

第二,飘。格式偶尔出错,选出一个根本不在候选里的答案,同样的输入跑两次结果不一样。每一种情况,工程师都得写一段兜底代码。

第三,也是最致命的:它不知道自己有多确定。

让大模型“顺便报一个置信度”,它多半会自信地报出 0.9 以上的数字——答对时是这样,答错时也是这样,对齐训练带来的过度自信,都会让这个数字失真。

而企业真正需要的,恰恰是这个数字。

九成把握的退款判断可以自动放行,六成把握的必须交给人工复核。

没有可信的概率,就没法设阈值;没法设阈值,自动化就只能永远停留在“辅助”。

PART

02

从 Jev 到 Instinct,让模型专门做判断

MODELS BUILT TO CHOOSE

决策模型换了一种思路:不生成文本,直接回答一个结构化问题。

输入是三样东西:当前的对话状态,判断问题(业务规则就写在问题里),候选答案。输出只有一样:每个候选答案的概率。

还是开头那副耳机:

图片

系统拿到的就是一组可以直接写进业务逻辑的数字。

再跟大家聊聊,为什么说这个决策模型就比较适合客服场景呢?

任务定义本身成了输入。同一个模型,这一次判断情绪,下一次执行退款规则,再下一次选择工具,不需要为每个任务单独训练一个分类器。规则改了,改的是一段文字,不必重新标注数据、重新训练。

一次计算,给出全部答案。不用逐字生成,一次前向计算就能得到所有候选的概率;同一段对话上的多个问题还可以共享计算,一次跑完。

诺贝尔经济学奖得主丹尼尔·卡尼曼在《思考,快与慢》中,把人的思维分为两套系统:系统一快速、凭直觉、几乎不费力;系统二缓慢、审慎、依赖推理。

一位资深客服一眼看出“这单该换货”“这位用户快要投诉了”,靠的多半是系统一。

图片

这个心理学概念,最近成了硅谷 AI 圈的热词。

9 月 15 日,旧金山的 TypeSafe AI 结束两年隐身,宣布完成 4000 万美元种子轮融资,并发布首个“系统一模型”Jev。公司创始人是前 OpenAI 研究员、InstructGPT(ChatGPT 的技术前身)论文作者之一。Jev 不生成文本,只输出带置信度的决策;TypeSafe 宣称,在同类任务上,它比前沿大模型最多快近 200 倍、便宜 400 多倍。

发布后短短数周,Jev 已被 Vercel、OpenRouter 等平台接入,LangChain 推出了配套集成,开发者社区也出现了专门的开源评测 jevbench。

用不同的模型做工作流里不同的事,正在从一个观点变成一种架构。

热度之外,企业更关心的是落地:模型能不能部署在自己的环境里,懂不懂自己的业务。

ZooWork 给出的答案是Instinct(直觉)

Jev 目前通过托管 API 提供服务;Instinct 则同时提供两种方式:既有稳定的托管 API,价格低于 Jev,也开源了Instinct-4B 模型权重,支持企业本地部署,入口如下:

开源项目地址:github.com/SerendipityOneInc/instinct

模型HuggingFace:huggingface.co/srpone/instinct-tuned-4b

图片

在场景上,Instinct 直接瞄准客服这类需要海量、快速决策的企业业务。

而且扒了一下这个团队的信息,ZooWork 核心团队成员来自谷歌、阿里巴巴、字节跳动等头部科技公司,在 AI 算法、模型训练与推理优化方面积累深厚。之前团队开源的时尚图文检索模型 ZooClaw-FashionSigLIP2,在全部评测中均达到同类开源模型的最佳水平,效果超过月下载量超 40 万次的明星模型 Marqo-FashionSigLIP,贼猛。。

图片

据 ZooWork 介绍,Instinct 目前有两种参数规模、三条模型方案。

Instinct Dual 4B面向成本敏感、响应频繁的判断环节。它以 Qwen3.5-4B 为基础,分别计算两个候选项顺序,再合并判断结果;两个顺序可并行执行。意图分流、工单路由、工具选择等任务,可以从这条轻量方案开始。

Instinct Tuned 4B是经过决策任务后训练和概率校准的 4B 方案,以单顺序完成判断,在模型体量、效果与调用价格之间取得平衡。规则判定、工单分类、情绪分级等日常决策,是它重点面向的应用方向,也适合作为企业进一步做场景适配的起点。

Instinct 27B以 Qwen3.8-27B 为基础,采用单顺序候选得分读出,并对服务链路做了激进的性能优化。在三款方案的现有公开题自测中,它的正确率最高,可优先用于条款较多、上下文较复杂的规则判断,以及更看重判断质量的质检和复核环节。上述是选型方向,具体效果仍需用企业自己的业务样本验证。

来看看实力吧,先看同一批公开题。在 JevBench 历史公开的 231 道决策题上,Instinct 27B 答对 202 道,后训练的 Tuned 4B 答对 198 道;Jev 1.13.0 的公开逐题记录为 200 道。两者分别比 Jev 多 2 道、少 2 道,显示了这两条方案在该公开题集上的竞争力。

图片

全集结果呈现了更完整的取舍:Jev 的整体决策质量仍领先;Instinct Dual 4B 的校准分与 Jev 接近,但不能将校准分等同于答对能力。两款已测 Instinct 的官方原始 P50 约为 253–260 ms,Jev 为 616.5 ms,说明低时延是它们值得关注的一项特征。

综合分还取决于怎样计价。当前官方为两款 Instinct 采用基模参考价格估算成本,并将原始延迟乘以 2,作为 demo 服务承载生产负载的假设;Jev 使用其标准公开价,延迟不乘该系数。因此,官方综合分不能直接代表按 Instinct 当前标价购买服务时的性价比。

图片

不过,ZooWork 方面更看重的,是这些判断如何进入真实的客服流程。通用基准只能证明模型“会判断”,证明不了它“懂客服”。

客服数据有自己的脾气:口语化,错别字多,一句话里夹着好几个诉求,情绪表达很含蓄,业务规则里全是例外条款。而客服流程里的许多关键动作,恰好可以拆成边界明确的判断:属于哪类诉求、是否满足退换条件、应该调用哪个工具、是否需要转人工。

Instinct 的结构化选择与概率输出,适合嵌入这些需要反复、快速执行的决策环节。

ZooWork 将客服作为 Instinct 的重点落地方向,围绕意图、规则判定、情绪、路由、质检和工具选择做场景适配。企业可以把自己的业务规则和必要上下文交给模型,也可以以后训练的 4B 方案为起点,进一步适配企业样本。

实际接入时,先用历史工单验证,再以影子模式观察,把达到业务要求的判断交给模型,不确定的情况转给人工。

Ps. 这里展示的是通用决策评测,客服专项效果将以相应业务评测为准。

PART

03

焚决:判断交给 AI,企业怎样才能放心?

FROM CONFIDENCE TO ACTION

那么在客服系统里,决策模型最适合先切入以下五类场景?

图片

CASE 01

智能分流。

用户第一句话进来,由 2B 这样的小模型判断意图和紧急程度,决定进入哪个处理流程。这是调用量最大的环节,小模型的延迟和成本优势最明显。

CASE 02

售后规则判定。

把退换货、补偿、价保等规则直接写进问题里,由模型判断当前情况属于哪一类。规则更新时只需修改文字,不必重新训练。

CASE 03

情绪与升级预警。

实时判断用户情绪和投诉风险,高风险对话自动提升优先级、转给资深客服,避免小问题拖成大投诉。

CASE 04

全量质检。

过去质检只能抽检几个百分点的对话,现在可以对每一轮回复做合规判断:是否使用了禁用话术,是否做出了越权承诺,是否遗漏了必要告知。

CASE 05

Agent 的下一步动作。

在客服 Agent 里,“下一步调用哪个工具”本身就是一道选择题。由决策模型选定动作,再交给生成模型组织语言。

决策模型的价值,最终落在一件事上:它给出的概率可不可信。

模型说有九成把握的时候,它应该真的有九成是对的。这叫“校准”。

校准做好了,自动化才能分层:高置信,直接执行;中置信,执行,同时进入抽检队列;低置信,交给人。

图片

阈值怎么设,取决于判断错了代价有多大。发一张五元优惠券,和批一笔大额退款,显然不该用同一把尺子。

这也是不少客服 AI 项目卡住的地方:测试集上的平均准确率很好看,但没人敢让它自动批退款,因为没人知道它哪一次是在猜。

对此,ZooWork 方面表示:

“准确率决定模型能不能用,校准决定企业敢不敢用。”

ZooWork 的建议是:不要只看模型在测试集上的平均准确率,而要在自己的业务数据上检验概率是否可信,并在上线后持续监控。客服数据会随着大促、新品和政策调整而漂移,今天校准良好的模型,三个月后可能就需要重新调整。

当然,决策模型也不是万能的,很多问题它不做,比如写回复、查数据、开放性题目,这些回答不了,我们要想清楚这三条边界,决策模型才能放在正确的位置上。

图片

对于想尝试决策模型的企业,ZooWork 也给出了他们的建议。

图片

第一步,把判断点写成问题。梳理现有客服流程里的每一个判断节点,按调用量和出错代价排序;再把每个节点写成“问题 + 候选答案”,业务规则用自然语言写进问题里。

第二步,选好规格,影子模式跑一遍。高并发分流用 0.5B,常规判定用 4B,复杂规则和质检用 27B。先与现有系统并行运行,只记录、不执行,对比结果,检查概率分布是否可信。

第三步,分层上线,闭环迭代。先把高置信、低风险的判断交给模型自动执行,再逐步扩大范围;人工复核的结果回流为训练和校准数据,让模型越用越准。

PART

04

结语

TRY WITH YOUR OWN DATA

之前有很多客户在好奇整个 AI 客服系统的搭建和思路,今天正好借着这个开源项目给大家分享一下~

过往的情况下,AI 客服会把话说得更漂亮,但是整个执行过程会非常缓慢。

但现在,决策模型把每一个判断,变成一次快速、可度量、可设阈值的调用。

做选择题,就别让大模型写作文。

正在推进客服自动化的团队,可以通过 ZooWork 申请试用,用自己的数据试一试。截至 2026 年 9 月 29 日,官网显示 Instinct 处于免费预览阶段,尚未启用计费,同时已公布以下单价:

模型
每百万输入 token 的公布价格
27B:instinct
0.03 美元
4B:instinct-dual-4b、instinct-tuned-4b
0.01 美元

所有型号均不收取输出 token 费用。

希望自行部署和评估的开发者,也可以从Hugging Face 上的 Instinct-4B 模型和GitHub 项目仓库入手,用自己的业务数据检验效果。

大家日常工作生活中,最难做的那个判断是什么?欢迎在留言区聊聊。

最后,祝大家节日快乐!!!

假期玩得愉快~

以上。

/// END · BETTER DECISIONS

文章标签模型发布开源
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多