Token导航 LogoToken导航TokenDH.com

那个被你们彻底斩杀的,居然是最强国产模型?

更新时间 2026-09-04来源 CTO范凯正文 2979字阅读约 10分钟22 张图片
上期我说,要把云端的国产主力拉出来正面打一场。

这期,我打完了。

但在说结果前,先问你一句——

你发现没有?国产模型,每次出新版都在"斩杀"。GLM 斩杀 DeepSeek。千问 27B 斩杀全场。现在千问 3.8 Flash 又号称斩杀。

图片

真的吗?还是又一个噱头?

你是不是已经被搞懵了——到底哪个真好、哪个是吹的?该把哪个换成日常主力?

今天,我不看跑分,不看宣传,不看谁喊得响。

我把我自己每天在干的事拿出来,把这五个当红的模型,真跑一遍。

我给你个明确的答案——日常主力,用哪个;高峰想省钱,换哪个。

被"斩杀"的那个,恰恰是你最该用的。

想知道为什么?走。

我测的是什么

先说清楚我怎么测的。

我测的,就是我每天在干的事——不是跑分,不是榜单。

图片

五个模型。千问 3.8 Flash、GLM 5.3 Flash、DeepSeek V4 Flash——前三个,国产当红主力,大家每天在用的 Flash 版。

外加两个参照:GPT 5.6 Terra,国际顶级;还有个 Kimi K3,我顺带测的——结果它成了这次最惨的一个,这个我们后面再说。

先说清楚我不测什么:我不测编程,也不测满血版 Pro——那些是 AI 最擅长的刷分评测,但跟我们每天真在干的活,是两回事,评测数据不代表真实的能力,Pro 版本也不是我们平时干活的主力。

怎么测?两个任务。

图片

第一个,海量文本摘要。我知识库里三天的新闻日报——十四篇、将近三百 K 字——让模型读完,提炼重点,输出结构化报告。考的是它在大信息量里抓重点、理逻辑。

第二个,控制浏览器抓数据。让模型自己操纵 Chrome,打开我的 YouTube 后台,抓最新三条视频的数据,再写一份洞察报告。

这一步其实是两重考验——它既要真能把数据从网页里抓出来,又要看得懂数据背后的含义。能稳稳走完这两步的模型,做复杂 Agent 任务的可靠性,才算数。

就这两个任务,够不够代表性?

反正我测完,真相跟榜单上的,完全不一样。

走,先看国产三巨头的对决。

三巨头对决:千问 / GLM / DeepSeek / GPT

先说第一个任务,海量文本摘要。

图片

千问,2 分 21 秒跑完。速度还行。

但把它的报告打开,仔细往里看——

它的大框架没问题,S 级、A 级该有的都在。问题出在子分类:你看英伟达那条新闻底下,子分类整理得乱——有的塞得不对,有的该归类没归对,逻辑不清楚。

这说明什么?思考深度不够。

大框架它搭得起来,但往里填细节的时候,就露馅了。

图片

第二个任务,控制浏览器抓数据——它花了 8 分 40 秒。

图片

为什么这么慢?

我自己的判断是:它抓网页的时候反复失败、反复重试,才把时间拖得这么长。

不过有两件事板上钉钉:第一,它慢,是真的慢;第二,它交出来的报告,深度和条理,也真有欠缺。

两个任务综合看——千问 3.8 Flash,在这三巨头里,基本垫底。

下一个,GLM 5.3 Flash。

图片

任务 1,3 分 33 秒——比千问还慢了一分多。

但把它的报告打开,区别一眼就看得出来:

图片

从大的分类到里面的明细,结构逻辑明显比千问细致。

这是细节功夫。

任务 2,6 分 14 秒——比千问的 8 分 40 秒,快了 2 分多;洞察也更深:它不光告诉你哪条视频表现好,还告诉你为什么好、下一步怎么改。

图片
图片

它慢不慢?慢。但这个慢,我接受——

因为它是实实在在把活干完、把分析做出来的那种慢,不是卡在那干等。

现在,到了被评测数据斩杀的 DeepSeek V4 Flash 了。

图片

任务 1,1 分 19 秒——全场最快。

而且它整理出来的东西,是这几个模型里结构化最清晰的:S1 英伟达、S2 美联储、S3 国产开源、S4 收购、S5 Agent 商业化、S6 地缘竞争,一层一层,分得清清楚楚。

你拿它跟千问、GLM 的报告并排看——它这个架构,可以直接当模板用。

图片

任务 2,3 分 24 秒。

图片

比千问的 8 分 40 秒,快了一倍半还多。而且质量最高的还是它:数据总览、差异来自哪、哪个指标决定什么、怎么修正、为什么要这么改——一整套,全给你捋明白了。

图片

所以国产三巨头——结果毫无悬念:

最快的是 DeepSeek,最好的也是 DeepSeek。

图片

那 GPT 5.6 Terra 呢?我拿它当参照,是想让你看看国际顶级是什么水平。

图片

任务 2,它 1 分 47 秒——比 DeepSeek 还快。

但打开它写的报告——

图片

它真的很像理科生:干瘪、惜字如金,好多重要信息,它懒得给你写全。

所以国际顶级的画像很清楚:执行效率顶级,但长中文输出,是硬伤。

——这句话的意思是:DeepSeek 又快又好这件事,含金量比你以为的还要高。

Kimi 翻车

测之前我也没想到,它是这次最惨的一个。

别的模型,慢也好、写得差也好——至少,把活跑完了。

Kimi 呢?它直接干不完。

在第二个任务——控制浏览器抓数据——它执行到一半就报错了。

我一开始以为是偶发,多试了几次发现不是:它要么报错,要么提示这是"企业级功能",要么干脆过载。

图片

你发现没有——它不是"回答得不好",它是"干不了这个活"。

一个模型,你让它干个稍微复杂点的真活,它直接趴窝。那不管它跑分多高、宣传多猛——在真实工作里,它就是个用不了的模型。

说句公道话:Kimi 翻车,不一定是模型本身能力不行,更可能是它背后的算力和服务,接不住这种复杂的 Agent 任务。

因为一个模型真正用不用得了,最后靠的是背后那套推理架构——能不能稳稳地,把你调用的每一个任务跑出来。

五个,都测完了。

图片

结论,其实已经很明显了。

被斩杀的,反而最强

回到开头那个问题——

被你们斩杀掉的那个,究竟是不是真的不行?

DeepSeek V4 Flash。

五个里,唯一一个两个任务都又快又好的。

榜单上被压下去的那个,实测下来反而最强。

评测榜单上的数字,跟你每天真实用的,真的是两回事。

不是它跑分高、宣传猛就真的好用。真正决定好不好用的,是它跑你真实任务的时候——稳不稳、快不快、崩不崩。

千问的慢、Kimi 的趴窝、DeepSeek 的又快又好——其实是同一个答案的三种写法。

图片

这句话,不光是这次评测——你以后选任何 AI 工具,都用得上。

那问题来了:既然 DeepSeek 最强,是不是每个人都直接用它就完了?

这三个国产里,DeepSeek 最好。

但它真的太贵了。

图片

官方价,每百万 token——

千问:输入 0.8,输出 2.7。

GLM:输入 0.8,输出 2.8。

DeepSeek:空闲时输入 1.5,输出 4.5;高峰时直接翻倍,输入 3、输出 9。

你算一下总价就懂了——

同样跑个活,DeepSeek 空闲时段,也比千问、GLM 贵 60% 以上。

到了高峰,更是直接差 3 倍多。

所以,理出两条路就够了:

第一条,如果你不差钱——

那就直接只用 DeepSeek,它又快又好,一分钱一分货。

第二条,如果你追求性价比——

那就在空闲时段,狠狠地用 DeepSeek;

一到高峰,它贵到飞起,就换便宜的 GLM 顶一下。

为什么不拿千问顶?

千问质量不如 GLM,价格也没便宜多少——那我不如直接搞 GLM

最后说下我自己怎么用的,给你个参考——

真正关键的任务,我用 GPT 5.6 Sol,那是顶级的、替代不了的;

常规任务,我用 GPT 5.6 Terra;

中文大段输出,我就用 DeepSeek,挑它空闲的时候;

到了高峰,再换 GLM 顶一下。

图片

当然,这是我自己的用法,你可以按自己的场景去搭。

记住一句话——

别指望一个模型包打天下。

按场景搭着用,才是把 AI 用明白的样子

今天就说这么多。

记住一句话——

评测榜单会骗你,但你的真实体验不会。

被压下去的那个,才是最能打的。

觉得有用,点个订阅,我们下期接着拆如何在 Pi Agent 里面用我推荐的模型组合。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多