假期带孩子去上海转了一圈,中间见了几个 AI 创业的朋友,大家聊来聊去,基本上还是 Personal Agent。
印象里,差不多也是 10 月份,Claude Code 开始真正出圈。今年几乎同一个时间点,Personal Agent 也开始出圈了。Muse、Instinct,最近热度都非常高。
但不知道大家有没有注意到,Claude Code,包括后来 Codex 这一波 Coding Agent,让大家第一次特别直观地感受到,模型的智能水准,尤其是在长程任务里的能力有多重要。
Coding Agent 一下子把模型之间的能力差距放大了。
之前还是 Chatbot 的时候,两个模型回答同一道题,可能都能答得七七八八,看起来差距没有那么夸张。
但 Coding Agent 需要自己理解代码、完成规划、不断修改,再去跑测试,一项任务可能连续执行几个小时。
这个时候,模型能力稍微弱一点,前面几步可能就会直接走偏了。只有模型能力足够强,它才可能像一个经验很丰富的工程师一样,独立完成复杂的任务。
所以过去一年,大家其实一直在追逐更强的旗舰模型,重点强调 Coding 能力和长程任务。
模型和任务一直是咬合在一起的。
我觉得接下来,通用 Agent 和 Personal Agent 会让大家重新看到 Flash 模型的价值。因为 Agent 越往普通用户和日常工作里渗透,成本和速度就会变得越来越重要。
包括我看到最近豆包工作也已经上了豆包 2.1 Lite 这个 Flash 模型。
Coding Agent 处理的是复杂任务。理解代码库、完成规划、修改代码、执行测试,对模型能力的要求很高,所以大家愿意为了更强的智能付出更高的成本。
但通用 Agent 面对的任务类型更多,而且大量都是高频的日常工作,比如整理文档、分析数据。
换个角度看,豆包这个 Agent 产品就叫豆包工作,它其实很像 AI 时代的 Office,基本会覆盖我们日常办公里的大部分任务。
和 Coding Agent 的区别是,这类高频的任务,对模型能力的要求没有复杂 Coding 那么高。
整理文档、建个日历、搜索信息、分析数据,这些任务和复杂 Coding、深度研究,对智能的要求可能差几十倍。如果每件事情都调用最贵的旗舰模型,就太浪费了。
所以会发现,各家模型公司其实都在补 Flash 这一档的模型。
我给大家看一下,豆包工作里 2.1 Lite 的实际效果。简单来说,跟 Pro 相比,它最明显的优势就是更快,也更省额度。
下面这个任务,是我们在准备明年 AI Maker Summit 深圳站的会场。
我手里已经有一些从朋友圈看到的会场图片,以及之前零碎收集的资料,于是就把这些信息都发给豆包工作,同时选择 2.1 Lite 模型。
我让豆包工作先理解现有的资料,然后再去对应搜索补充信息,最后帮我做一轮对比,生成 Excel。
我上传的图片包括会场的照片、手写的文字等等,豆包 2.1 Lite 都能够理解这些信息。它的多模态理解能力在目前我用过的所有 Flash 模型当中都是拔尖的。
因为我绑定了飞书,所以它最后直接放到了飞书上,大家去看下面的截图,这类任务它还是相当得心应手。
关键是快啊,一共用了 7 分多钟时间,要是一换 Pro 模型的话,可能得 10 分钟起步。
做 PPT 的话,我个人认为审美也很不错。比如我把节前我们 Q3 的季度复盘内容发给了它,让它帮忙做一个 PPT。
下面这是最终的成品。
继续。我让它结合飞书中的沟通,帮忙梳理一下我们新产品的进展。下面这是最终生成的看板的 HTML 页面。100%满足我需求了。
至少在日常办公这些任务里,我自己的体感是,豆包 2.1 Lite 模型完全是够用的。
之前很多人提到 Flash,第一反应可能还是省成本,觉得它就是拿来处理一些边角任务。但接下来,像豆包 2.1 Lite 这样的模型,会承担越来越多真正的日常工作。
前段时间,Jeff Dean 还在谷歌时,和 Gemini 几位负责人一起聊到过 Flash 模型。他们提到,自己原来都没想到,竟然可以一代一代把 Pro 的智能重新塞进 Flash。
甚至在一些版本里,下一代 Flash 已经可以超过上一代 Pro。
当然,这其中核心的方法就是蒸馏。可以把旗舰模型想象成一颗柠檬,蒸馏就是把里面真正有用的汁挤出来,再装进一个更小的杯子。
所以我觉得接下来随着 Agent 能力渗透到更多的普通用户, Flash 模型会逐渐成为主力模型。
模型公司先花成本把最前沿的智能探索出来,然后等这些能力逐渐成熟以后,再通过蒸馏、训练优化等办法,把智能放到速度更快、成本更低的模型里。
当然,Flash 和旗舰模型本身就是互补的。所以现在很多 Agent 产品都开始探索模型路由,根据不同任务动态选择模型。
豆包工作里也提供了 Auto,大家如果不想自己选模型,直接勾选自动就好。
豆包工作这个 Auto 具体是怎么实现的,我现在还看不出来。但模型路由已经是确定的趋势。因为从逻辑上看,Agent 任务能够拆成很多步,而且每一步需要的智能都不一样。
旗舰模型可以负责整体规划、关键判断和复杂问题,Flash 模型再去搞定大量的具体执行。
如果任务执行过程中,发现 Flash 模型搞不定,也可以再切回更强的旗舰模型。
当然,这事也没那么简单。这中间还涉及到不同模型 Context 交接的问题,怎么快速判定任务的难度。
不过像 Jev 这种擅长分类、打分的模型,我觉得以后很适合用来做这一层判断。
总之我觉得,随着通用 Agent 和 Personal Agent 真正大杀四方的时候,Flash 模型会变成真正的主力。
因为不管是 Personal Agent 还是通用 Agent,它对 Token 的需求都会爆炸式增长,而且会越来越深入到那些非常琐碎的日常场景。
Flash 以后必定会从过去的省成本方案,慢慢变成 Agent 时代真正的基础设施。







