你好,我是蔚公子,毕业ALL in AI,专注于 AI 提效/企业赋能/教育
点击👇关注我,
分享真正能落地的AI方案,让企业和个人把AI用好
最近这段时间,国产模型是真的你方唱罢我登场。
前脚 DeepSeek 刚把视觉版开源了,后脚智谱那头牛就揭了身份,中间还夹着好几家在发新东西,基本上是一天一个热闹。
结果这两天,腾讯这波又来了。
混元发布并开源了新一代大模型 Hy4 preview。
先说说基本情况。
它用的是 MoE 架构,总参数 770B,单次激活 49B,上下文长度做到了 1M。发布当天 WorkBuddy、CodeBuddy、元宝、ima 这几个腾讯自家产品就已经同步接上了。
顺带说一句,WorkBuddy 这两周是限时免费的,到 9 月 10 号晚上截止,想上手的可以趁这波✨
再看官方怎么说的。
腾讯给 Hy4 preview 的定位是为生产力而生,说它是跟内部软工、游戏、金融、安全这些领域的顶尖专家一起共建数据训出来的。
官方点名的四个方向也很具体。
软件工程这块,重点是长程开发任务的理解、规划、调试和验证,同时提升前端开发的视觉审美和交互质量。办公分析这块,主要是复杂办公环境理解和金融分析,优化数据分析和跨文件协作,要能完成从信息处理到文档表格和演示文稿交付的整条流程。
游戏开发这块的说法最直接,一句需求直接生成可玩原型,而且能熟练使用游戏引擎。科学研究那块就更专业了,覆盖 AI 研发、分子动力学模拟、凝聚态物理这些。

关于跑分,官方放了十二张对比图,对手是 Qwen、DeepSeek、GPT、GLM、Kimi、Claude 这一圈。
不过更有意思的是跑分之外的那一项。腾讯这次找了 163 位内部专家,拿 203 个真实工程任务做了盲测。结果是它对 GLM-5.3 平均分 2.99 比 2.92,胜率 46.8%,对 Kimi K3 是 2.99 比 2.94,胜率 51.2%。
说实话,这个差距不算大,就是略微领先那么一点。
但官方这次点名的四个方向倒是很明确:软件工程、办公与分析、游戏开发、科学研究。
方向都摆出来了,那就别猜了,直接开测。这次我准备了八个 Case,直接把官方说的这个四个方向全部打透,看看到底怎么个事~
废话不多说,直接开搞👇

一、让它从零做一个 3D 机甲 Boss 战
第一个我要的是一场完整的机甲对战,用动作游戏看效果。
提示词:
请从零制作一个可以直接运行和游玩的 3D 机甲 Boss 战游戏。
场景设定在一座未来城市或大型未来工业设施中,玩家驾驶一台机甲,与一个体型明显更巨大的 Boss 进行完整战斗。
玩家机甲至少具备:移动、冲刺、闪避、远程攻击、近战攻击。
Boss 不要只是一个血量很厚、站着挨打的模型。至少设计 5 种具有明显差异的攻击方式,例如横扫、砸地、导弹、激光、冲锋、范围攻击等,由你自行设计。Boss 的重要攻击最好有比较明确的攻击前摇,让玩家可以通过观察进行闪避。
整场 Boss 战至少需两个阶段。当 Boss 血量下降到一定程度后,第二阶段不仅数值变强,最好连攻击方式、战斗节奏、视觉状态或场景效果也发生明显变化,让玩家能够清楚感觉进入二阶段。

开场那一下是真有点东西。
机甲一转身,两台机器面对面站定,周边是夜晚的城市,楼房和灯光都在,那个氛围感说实话已经有一点真游戏的味道了。
打起来之后,最让我意外的是它真给我做出了三个阶段。
我每打完一段血条,Boss 是真的会发生形态变化。技能它也给了好几个,激光扫射、直线冲撞、导弹发射,还有一招是它自己在脚下踩一下,直接砸出一片伤害区域。
当然要吐槽一点,难度确实不算低。我打了快十分钟,一直打到 Boss 只剩最后一格血,结果我自己先没血了😅
当然,问题也不少。
一是 Boss 有点呆,攻击是有,但脑子谈不上。
二是血条太厚,而且它的机制本来挺好,要先打掉护甲再打本体,可护甲恢复得太快了,你打两下它就又回来了,节奏很容易被拖垮。
三是操控。转向和镜头偶尔会失灵,虽然按一下 ESC 调整一下还能拉回来,但过程中确实会卡。
四是坐标有问题。我这台机甲本来是站在地上的,打着打着,我的头就快钻到地底下去了。
不过我的判断还是正面的。能做到今天这个程度我觉得已经可以了,再稍微优化一下,真的可以当个小样丢给小朋友玩上一阵子。
二、废弃商场里的丧尸生存
刚刚那个说到底还是一个在规定场地里的射击游戏,那第二个我们就再升一档,玩一把末日生存。
场景换到废弃的大型购物中心。
提示词:
请从零制作一个可以直接运行和游玩的 3D 第三人称丧尸生存射击游戏。
场景设定在一座已经废弃的大型购物中心,整体氛围偏写实、压迫、末日生存感,不要做成简单的方块 Demo。
玩家需要具备完整的基础战斗能力,包括移动、奔跑、瞄准、射击、换弹等。
游戏中至少设计 3 种行为明显不同的敌人,例如普通丧尸、高速冲刺型丧尸、特殊攻击或远程攻击型敌人。敌人需要能够主动发现、追踪并攻击玩家,而不是只在固定位置等待。
地图至少包含几个明显不同的区域,例如超市、餐饮区、零售店铺等,并加入弹药、医疗包或临时增益道具,让玩家需要在战斗和探索之间做选择。
这个 Case 确实不容易。
一开始出来的东西说实话有点惨不忍睹,我中途改了两次,前后跑了大概六个小时。

先说操控,非常顺。第一版的时候我基本上摸不着南北,但六个小时调下来,效果还是不错的。
而且它不仅有作战兵器,还配了手电筒,地上的药品也可以自己去捡,捡到不同的还有不同的增幅效果。
最让我觉得 OK 的是那个肾上腺素包。捡到之后你是真的跑得快了,这个在逃命的时候特别有用👌
比较让我惊喜的是丧尸,它确实做了好几种。一开始是普通的,然后是那种加速冲向你的,第三种更有意思,它会往你这边扔个东西过来让你中毒。而且不同阶段冒出来的还不一样。
同时地图也不小。一开始我还以为它会糊弄我做个小房间,结果没想到真做出了起码三四片空间。
最让我上头的是氛围。
那个环境是真暗,很多地方你根本看不清前面有什么。我正摸着黑往前走,突然从旁边窜出来一个丧尸,跑得还特别快。
我当时是真有点儿被吓到了😦
难度也不小,我玩了好几把都没完全通关,但玩着还挺有意思,玩完还想再来一把。
说实话这一个跑完,我心里有个念头直接就冒出来了。
很可能在未来,一个人开发一个自己玩的小游戏这件事,是百分之百能完成的。
以后可能就不是 4399 小游戏了,是 AI Coding 小游戏。
三、北上广深,做一个未来城市数字展馆
前两个是游戏,第三个开始我们来做点更有实际价值、也更严肃一点的东西,切到前端。
部分提示词:
请制作一个高级感很强的交互式数字展馆网页,主题为《中国未来城市地标》,展示北京、上海、广州、深圳四座城市中,最具有现代感、未来感和科技感的代表性真实建筑。
每座城市请选择大约 2 到 3 座真正存在的代表性建筑。可以优先考虑北京的中国尊、丽泽 SOHO,上海的上海中心大厦、上海天文馆,广州的广州塔、广州大剧院,深圳的华润总部大厦春笋、平安金融中心、腾讯滨海大厦。如果你认为有更合适的建筑也可以自行调整,但必须是真实存在的建筑,并核实基础信息。
整体不要做成普通旅游网站,也不要做成廉价霓虹灯式赛博朋克。我要的是一种未来城市建筑数字博物馆或高端科技展览的感觉。
这个 Case 得先说明一下,它是有残缺的。
因为我这边只跑了两个多小时就收了,所以它没做完。

开场是一个虚线勾出来的地球,上面标着四个城市的点。乍一看没什么问题,但你转过去就会发现,这个地球其实只做好了一半,背面那半还没生成完。
不过点进去之后,该夸的还是得夸。
每一座城市它是真做出了对应地标的样子。每个城市做了一到两栋,有的地方做了三栋。从标识上看它其实规划了四五栋,只是没全生成出来。

关键是形还挺像的,不是随便糊一个方块。点击任意一栋建筑,右边会弹出这栋楼的信息面板,介绍写得也还行。
我给它打 70 分。再优化一下我觉得能到 80。
这个方向我觉得挺有价值的,不管是做建模、做游戏的基础素材,还是做展示类的东西,这条路是通的。
四、从微观到宇宙,一路缩放过去
第四个是我个人最喜欢的一个,做一个相对浪漫一点的,而且具有一些人文色彩一些的内容,从一个庞大的宇宙到微观的粒子,用视觉的效果呈现一遍👌
提示词:
请制作一个具有强视觉冲击力的交互式网页,主题叫《从微观到宇宙》。
我希望用户可以通过滚轮、触控板或者其他自然的交互方式,从极其微小的尺度不断向外缩放,一路看到整个可观测宇宙。大致尺度可以包括粒子、原子、分子、DNA、细胞、人体、城市、地球、太阳系、银河系、星系团、可观测宇宙。
重点要求:不要做成 PPT 式的一页一页切换。我要的是一种尽量连续的空间缩放体验,让用户真正感觉自己一直在从一个尺度向更大的尺度穿越。不同层级之间需要有比较自然的视觉衔接,尽量避免突然黑屏或者完全跳到另一张页面。
可以根据需要使用 WebGL、Three.js、Canvas、SVG、粒子系统、CSS 动画等技术,具体技术方案由你决定。
这个我也改了两次,同样跑了六个小时左右。

结果是真的有些震撼。
第一版其实做得有点惨不忍睹,就是一团光团。但第二版出来我滑动的时候,确实有点愣住了。
画面从可观测宇宙一路缩回来,星系团、银河系、太阳系、地球、城市,然后一头扎进人体,再往里是细胞、蛋白质。
这个东西已经不只是炫酷了,是真的有冲击力。
我当时的感觉是,这完全可以当成一个生物或者地理学科的窗口,让人用它来看一遍这个世界的尺度。
技术上难度可能并没有那么大,但视觉这一关它是过了的。
同时瑕疵当然也有。主要是缩放的灵敏度没调好,有点太灵了,所以有些中间过程你一滑就过去了,看不清,有几个地方也跳得偏快。
不过这个后面优化一下就能解决。说句实在话,这东西要是再配上一段 BGM,绝对是一个很好的展示素材。
五、全球人形机器人产业深度研究
前面我们还是在做代码相关的东西,从这里开始,我们来做点真正对工作有用的,做一下研究。
我要的是一份全球人形机器人的产业研究,覆盖多个主要玩家,交付 Word、Excel、PPT。
部分提示词:
请做一份全球人形机器人产业深度研究。我不希望得到一篇泛泛而谈的行业介绍,而是希望真正回答:截至目前,全球人形机器人到底发展到了哪一步?哪些公司是真正在落地,哪些还主要停留在 Demo 和发布会阶段?
请联网研究全球主要玩家,至少覆盖 Tesla、Figure、Boston Dynamics、Agility Robotics、Apptronik、1X、优必选、宇树科技、智元机器人、傅利叶。
对每家重点公司,请尽可能核查代表性产品、技术路线、公开展示过的真实任务能力、是否已进入真实工厂或仓库场景、已完成的实际部署与公司宣布的未来目标、是否披露价格成本订单产量,以及当前最大的瓶颈。

东西是交出来了,而且量大得有点吓人。
Word 报告三万多字,里面塞了 48 张表格。Excel 拆成了 15 个工作表,光是成本与价格那一张就有 96 行,来源底稿有 87 行。PPT 是 25 页。

但真正让我意外的不是量,是它自己造了一套证据分级。
Excel 里有一张表叫真实部署案例库,它把每个案例都打了标签,从 L1 到 L4,L1 是发布会 Demo,L2 是内部测试,L3 是小规模试点,L4 才是真实部署。

比如其中一个案例,它标了 L4,还附上了部署时长和班次这些细节。但同一家公司的另一个案例,它标的是 L3 到 L4 之间,备注里写着这个说法来自公司自己,目前还没有第三方独立核实。
这个动作我是真没想到。

我只是要求它把两件事分开,它自己搞了一套标准来执行这件事。
PPT 里也是这个调子。有一页标题直接写的是全行业只有个位数案例,还有一页叫三个最容易被误读为已商业部署的玩家。
当然,对不对另说,这些并非只是罗列,是敢下判断。
六、泡泡玛特的财务分析
最后一个,是财务分析,这两年泡泡玛特兴起,在一二线城市绝对算是爆火了,基本上每一个商圈都有一个潮玩店,就它当例子了。
部分提示词:
请做一次完整的泡泡玛特经营与财务分析。核心问题是:LABUBU 爆火之后,泡泡玛特的钱到底从哪里赚来的?过去两年半,它的生意到底发生了什么变化?
请优先使用泡泡玛特官方发布的 2024 年报、2025 年报、2026 年中期业绩及相关公告,不要主要依赖媒体二手报道。希望你把三个报告期连起来看,而不是分别做三份财报摘要。
至少回答:核心经营指标发生了什么变化?增长主要来自中国还是海外?哪些 IP 真正在贡献增长?各 IP 的收入结构和集中度有没有变化?线下门店、机器人商店、电商渠道分别发生了什么?利润增长主要来自收入增长,还是毛利率和费用率改善?当前最值得关注的风险是什么,不要套模板,请根据财报实际数据判断。
先说观感上的一个明显区别。
这两份 PPT 的风格完全不一样。机器人那份偏严肃,大量用表格,一页一页压着信息走。泡泡玛特这份是 18 页,几乎每一页都配了图表。

一个像研究所出的报告,一个像投行的路演材料。同一个模型,交出两种气质,这一点我觉得挺有意思🧐
内容上,Word 一万三千多字,Excel 拆了 12 个工作表。
它还单独做了一份来源底稿,里面有一张表叫数据点追溯,226 行。每一个用到的数字,它都标了来自哪份文件、第几页、原文是怎么写的。
七、最后再来两个科研 Case
什么,你以为就完了?Nonono!
前面测的基本还是游戏、前端和办公,那腾讯官方不是还专门提到了一个方向叫科学研究吗?所以最后我又加了两个稍微硬核一点的 Case。
一个做天体力学数值实验,一个直接研究过去 20 年黄金价格到底是怎么涨起来的。
1、从牛顿引力出发,数值复现开普勒第三定律
第一个我选的是经典天体力学。
这次不是让它查一个现成答案,而是从牛顿万有引力开始,自己建立太阳和行星的轨道模拟,然后用模拟出来的数据去研究轨道周期和半长轴之间到底是什么关系。
部分提示词:
请完成一个完整的经典天体力学数值实验。
从牛顿万有引力定律出发,自行建立太阳—行星二体轨道数值模拟,不要直接把开普勒第三定律写进模型。
为多个具有不同半长轴和初始条件的行星建立轨道,通过数值积分得到完整运行轨迹和周期。
然后只根据模拟得到的数据,研究轨道周期 T 与半长轴 a 之间的关系。
请绘制多个典型轨道,计算每组轨道周期,对 log(T) 和 log(a) 做拟合,独立估计幂律指数,同时检查系统总能量和角动量是否守恒,并比较不同积分方法和时间步长带来的误差。
完成数值实验后,再和开普勒第三定律的理论结果进行比较。如果结果偏离理论值,不要为了迎合答案修改数据,而是分析原因并重新检查计算。
跑出来之后,我第一感觉就是:还真有点科研报告那个样子了。



当然这个结果漂亮得都有点吓人,所以它后面自己又做了不少检查。真实行星那一组结果出现一点偏差之后,它也没有直接把数字改掉,而是又去做对照找原因。
视频更详细,录屏都录了一分钟,这细节还是有的👇
具体这些科学计算到底是不是每一处都完全正确,我无法替它下这个结论。 但至少从交付结果来看,它已经不是简单给你一个答案了。
2、过去 20 年,黄金到底为什么涨?
第二个我换了个完全不同的方向,直接研究黄金。
因为这件事情我们平时听到的说法太多了,那这些话到底有多少是真的?我就直接让它把过去 20 年的数据拉出来自己研究。
部分提示词:
请完成一项关于黄金价格驱动因素的完整定量研究。
核心问题是:过去 20 年,黄金价格到底主要受哪些因素驱动?大家常说的“美元跌黄金涨”“降息利好黄金”“通胀高黄金涨”,在真实数据里到底成立到什么程度?
请优先使用可靠公开数据源,例如 FRED、世界黄金协会、LBMA、美国财政部、美联储等。
至少研究xxxx等变量。
不要只做相关系数表,还要进一步完成滚动相关、多变量回归、分阶段研究、领先滞后关系和样本外检验。
不要因为某种金融叙事听起来合理,就直接把它当成结论,必须让数据决定结论。
最终交付完整代码、原始数据及来源、Excel 数据表、关键图表和完整研究报告。
这个出来之后,最大的感受就是图表是真的多。
各种相关性、滚动变化、回归结果、阶段对比、模型对比全给我画出来了,一口气出了 15 张关键图,Excel 数据底表还拆成了 33 个 Sheet。

而且有点意思的是,它最后还真没有完全顺着那些常见说法来。具体可以看视频👇
我觉得这个 Case 至少说明一件事,它现在已经能够把一个比较大的研究问题拆开,然后自己找数据、做分析、出图表,最后再整理成一份完整东西。
不过这里还是要说清楚,算是叠个甲:
这两个 Case 都只是研究性测试,具体数据和结论不一定完全准确,仅供参考。正式科研或投资判断,还是要专业人士复核。
八、蔚公子的洞察
八个跑完,我说说自己的感受。
第一,效果是真的在追上来了。
有几个地方确实超出我的预期。机甲那个 Boss 战我要的是两个阶段,它给了三个,而且每个阶段的形态和技能是真的会变;
宇宙缩放那个第二版出来,视觉这一关我觉得是过了的。
后面两份研究更明显,它不只是把资料堆给你,还自己搞了一套证据分级和数据追溯,这个意识我是没想到的。
这些东西拿出去给人看,不丢人。
第二,但大家的期待值实在太高了,所以一用起来就爆了。
这几天基本上是一用就卡,思考时间特别久,你就只能在那儿干等着。
说实话这也从侧面说明了热度。而且腾讯自己在发布的时候就承认了,这是 Hy4 的一个早期版本,明说还有已知问题,比如复杂任务上会长思考、有过度自我验证的倾向。
我这几天实测下来的体感,跟这句话是完全对得上的。很多时候它就是在反复地自己检查自己。
第三,说到底还是算力得跟上。
现在这个响应感是不太够的,跑一个复杂任务,你的等待成本其实挺高。

具体说两个我觉得最该改的地方。
一个是它运行的时候,鼠标是有点动不了的。这个我真的建议优化一下。因为你等于被它整个占住了,既不能去干别的,也没法中途插一句话调整方向,只能坐在那儿看着它转。
另一个就是等待时间确实有点久。它跑完一个结果要花的时间是真不短,我这八个 Case 里有两个都是六小时起步。对真正要拿它干活的人来说,这个是要算进成本里的。
这两个是比较大的硬伤。

最后说句实在的。
写了这么久文章,我已经不太想为了热度去单方面吹某个模型特别好了。
但有进步我们还是要看到。相对于腾讯以前的表现,我觉得这一次做得是不错的。
而且别忘了,这才是个 preview 版本。
到时候希望正式版能给大家来一次真正的亮相,也希望后续能继续发力。
毕竟大家的期望,一直都不低🔥







