还没等到豆包 Seed 2.2,看来字节还在憋大招。不过,这周字节更新了一个版本的 Seed 2.1 Pro,进步非常大。
我先说一下自己最近一个比较明显的感受。
国内外这些头部模型之间的差距,确实在慢慢缩小。拿绝大多数的 Coding 任务来对比,甚至都没办法直接感受到差别。
模型的整体能力越来越接近,但不同模型开始长出非常明显的侧重点。
比如 Seed 2.1 Pro,我觉得长处之一就是视觉理解能力。确实字节在这块做的非常好。
而且我觉得视觉理解这件事,接下来会越来越重要。
因为现在我们和 AI 交互,输入已经不可能只是文字了。越来越多真实任务里,Context 本来就是混合的。
让 Agent 开发一个产品,它可能要看设计稿,也要看现有网页,还要理解操作录屏。
或者让它处理企业里的老系统,很多时候文档根本不完整。真正有用的信息,可能藏在软件界面、截图、流程图甚至一段录屏里。
再比如游戏开发、3D、工业设计这些场景,纯靠文字描述,本身就会损失大量信息。
所以视觉理解能力强,它会直接影响模型处理复杂任务的上限。
下面这是火山引擎官方发的豆包大模型 2.1 Pro 的更新 Blog。
仍然强烈推荐大家去看看官方的 Blog。其实不只是豆包,所有新模型发布,无论国内还是国外,官方写的 Release Blog 都是非常重要的一手信息。
这些官方的 Blog 可能看起来有点像新闻稿,没有自媒体的文章那样有那么多的情绪和感受,但毫无疑问,官方的信息是一手的。我们从中可以关注模型团队的思路。
比如 Blog 会重点讲到他们这一次的能力提升,也会做一些 Case。其实从这些信息中就能看到这段时间模型的迭代重点。
模型团队愿意反复讲的东西,大概率也是最近花力气最多、最想证明的能力。
Seed 2.1 Pro 这一次,所有的更新都围绕企业生产级需求展开。这件事其实从 6 月已经开始了。
当时 Seed 2.1 官方专门说过,评估模型时会更关注真实工作流里的表现,而不只依赖静态 Benchmark。
到了这次 0915 版本,倾向已经非常明显。 大家看截图:
在官方 Blog 的第一部分,模型团队提到了可信搜索和幻觉。
Release Blog 肯定是倒金字塔型的,最前面的是最重要的。所以毫无疑问,字节现在非常关注 Agent 的可信度。
这个挺有意思,因为最近我看其他模型的 Blog,很少有人会从这个角度优化 Agent 的能力。
我解释一下为什么。
其实只要大家深度使用过专业 Agent,就会发现 Agent 最后的执行结果,除了和模型本身的能力正相关,还和它到底能够获取到什么样的 Context 有直接关系。
Context is King,这个观点我最近写文章一直在讲。
一类 Context,是企业内部本来就存在的知识库、文档、会议记录和各种业务数据。还有一类很重要的 Context,其实来自搜索。
现在搜索已经是大模型的基础能力了,但真正到了复杂任务里,模型能从搜索中拿到什么信息,里面其实非常有讲究。
因为今天互联网上的信息实在太多了。搜索到一个网页很容易,但这个网页到底准不准确,信息有没有过时,背后的信源靠不靠谱,这些都会直接影响最后的结果。
尤其是研究类 Agent,特别容易出现的问题是,它可能搜索了十几个网页,最后写出一份逻辑非常顺畅的研究报告。
乍一看什么问题都没有,但真正核验的时候,会发现里面有两三个关键事实根本缺少可靠依据。
如果只是普通聊天,这可能就是一次幻觉。但到了投研、财务、法律这些专业场景,这个问题就很严重。因为只要有几个关键事实无法核验,整份报告就很难让人真正信任。
这次 Seed 2.1 Pro 很重要的提升,就是优化了整个信息获取和核验的过程。诸如模型需要判断哪些来源更加可靠,哪些结果还需要继续核验。
如果不同来源出现冲突,还要继续寻找证据。最后得出来的结论,也尽可能能够回到具体的信源。
除此之外,还有两个很重要的能力提升:Coding 和长程任务。
这个其实都不用我多说,现在几乎所有模型都会卯着这两个方向提升,字节肯定也不会例外。
但如前面所讲,Seed 2.1 Pro 的亮点之一是 VLM,也就是多模态理解能力。这些和 Coding 以及长程任务结合之后,效果会格外好。
比如下面这个例子,我同事做的。
最开始的时候,我们只喂给模型一段 X 上的参考视频。最后做出来的结果,不管是对交互的理解,还是很多细节的还原,都挺惊艳的。
同样的任务我也试了一下 GPT-6 Astra,没有做到这个水平。
这个是原始图片:
我自己的理解是,差别主要还是出在 VLM 能力上。
因为同样喂一段视频进去,模型最后都会先从视频里提取关键画面,再去理解这些画面里的信息。最后拉开差距的应该还是到底模型能否更丰富的理解画面的信息。
下面这也是一个多模态理解的 Case。
参考视频是我在 X 上发现的。反正我的感觉是,对于复刻后再创造的内容,字节的新模型表现真的是很强。
我最近还在折腾做一个 AI 知识库的项目,没有全部完工。效果图如下。
我想把我们过去组织的所有大会的视频导入进去,形成一个知识库,这样用户问所有问题都可以在这得到新鲜的答案。
这个项目到现在,Doubao-Seed-2.1-pro 已经跑了 2.1 亿 Token。
我自己的感受是,这次更新以后,它在长程任务和 Coding 上还是挺出彩。从最开始的架构设计,到后面的实现细节,100%都是这个模型一路跑下来的。
现在产品已经基本成型,就差最后一轮测试。
另外,豆包大模型 2.1 Pro 这次在 3D 物体、空间理解这些专业方向上,也有不小的进步。
我记得今年 4 月字节发布 Seed3D 2.0 的时候,就已经明确把工业制造、具身智能,以及可以直接用于物理引擎的 simulation-ready 3D 内容,作为重点方向。
大家看看我做的这个 Case。我让豆包大模型 2.1 Pro 作为指挥者,然后调用 Blender,生成了一个白模预演视频。
因为我没装 Blender 的 MCP,所以它用了脚本的方式搞定:
下面这是成品:
最后又调用 Seedance 视频模型,完成了最终渲染:
对了,字节还有一款设计很有意思的模型,叫 Seed Evolving。
现在绝大多数模型还是按照版本来迭代。一个新模型发布以后,能力基本就固定在那里。后面想用到这家公司最新的模型能力,就得继续等下一个版本。
Seed Evolving 的思路不太一样。它基本上以周为单位持续迭代,而且 Model ID 一直不变。接入一次以后,不需要每次模型更新都重新切换版本,就可以持续用到最新的能力。
所以其实 Seed 2.1 Pro 这次更新里的很多能力,我半个月前就在 Seed Evolving 里陆续用到了。
这次 0915 版本发布以后,Seed 2.1 Pro 和 Seed Evolving 也同步到了同一个最新版本。
我觉得这个模型形态其实挺有意思的。因为大模型现在迭代实在太快了,按照过去几个月发一次大版本的方式,很多已经训练出来的新能力,中间其实要等很久才能真正释放给用户。
Seed Evolving 相当于把这个周期直接缩短了。
现在整个模型行业肯定还处在百模大战的阶段。
大模型最后的终局,可能会和云计算有点像。真正面向大众的通用模型不会有这么多,最后大概率就是几家头部公司。
剩下很多模型可能依然会存在,只是不会再成为大众每天都在使用的通用模型。
如果最后真的只剩下三四家头部模型公司,我个人非常看好字节会是其中一家。
这周二参加飞书的活动,没想到梁汝波也来做了个分享。他说,过去 50 年 IT 行业一共出现过四座高峰,PC、Web、Mobile 和 AI。
而且这些高峰隔得都非常远,基本上 15 到 20 年才会出现一次。真正难的是一家公司即便抓住了上一轮机会,也不代表下一轮还能继续留在牌桌上。
真正能够连续跨过几轮技术周期的公司,非常少。
比如 Google,它本身兴起于 Web,但到了 Mobile 时代抓住了机会,所以成功跨过了下一座高峰。微软则是另外一个很典型的例子。
它在 PC 时代几乎站到了最高点,但 Web 和 Mobile 两轮都没有真正登顶。
字节现在很明确,就是要在 AI 高峰继续登顶。所以他们今年的年度主题是勇攀高峰。说不定字节这一年两年内能够做出来让 OpenAI 和 Anthropic 刮目相看的大语言模型。
谁知道呢,都有可能。







