之前我曾经测试过Hy3 preview,它在多项评测数据中确实有明显的提升。

横向来看,Hy3 已经进入第一梯队,目前比较强的地方在于:
- BrowseComp 84.2,基本接近 GPT-5.5、Claude Opus 4.8,说明信息检索、复杂浏览、综合判断能力已经很强。
- ClawEval 68.5,仅次于 Claude Opus 4.8 的 72.1,说明 Agent 执行类任务进步很明显。
- Frontier Science-Olympiad 74.8,图里甚至是最高之一,说明科学推理和竞赛类题目表现不错。
- MCP Atlas 79.1,虽然不如 Claude/GLM/Seed,但已经和 Qwen、DeepSeek 接近,说明工具生态和协议调用能力可用性上来了。
短板也比较明显:
- SWE-bench Pro 57.9,相比 preview 提升很大,但距离 Claude Opus 4.8 的 69.2 还有明显差距,说明真实代码修复能力还有追赶空间。
- NL2repo 45.6,提升明显,但和 Claude 69.7 差距较大,说明从自然语言生成完整工程仓库这类长链路任务还不是最强。
- MathArena Apex 38.7,虽然比 preview 暴涨,但和 GPT-5.5 的 85.4 差距非常大,说明顶尖数学推理还不是 Hy3 的核心优势。
它的几个核心点还是比较明确的,首先就是它延续了 Hy3 preview 的 MoE 架构,总参数 295B、激活参数 21B,支持 256K 上下文。而正式版相比 preview 在稳定性、Agent、代码、办公、金融建模、前端设计、游戏制作等生产力场景上有明显的提升效果。
而且官方还给出了更低价格:输入 1 元/百万 tokens、输出 4 元/百万 tokens、缓存命中输入 0.25 元/百万 tokens。这个价格,对比同等的其他国产大模型,HY3的价格其实具有很明显的优势。

而在 OpenRouter 调用量排名上,Hy3 一直稳居前 5,说明这一次升级的混元 3 模型确实有相当强的外部开发者认可度。
这点其实很关键。因为 OpenRouter 上的调用量,不是厂商自己发榜,也不是实验室单点测试,而是开发者真实用 API、真实付费、真实跑任务之后形成的选择。一个模型能长期排在前面,说明它至少同时满足了几个条件:效果够强、价格够低、响应够稳、适配场景够广。

由于腾讯背靠游戏和微信两大场景,所以可以把混元深度应用到真实的业务场景上。WorkBuddy、CodeBuddy、元宝、ima、Marvis、QQ 浏览器、腾讯新闻、WeGame、微信公众号等业务接入后,可以通过真实用户的反馈,进一步优化自己的模型。
这也是腾讯相比很多模型公司的天然优势:腾讯不缺场景,不缺流量,也不缺复杂业务。 单纯拼模型参数和公开榜单,腾讯未必总能站在舆论最前面;但如果把 Hy3 放进微信、QQ、浏览器、游戏、办公、代码、知识管理这些高频场景里反复打磨,它的进化速度可能会比只靠 benchmark 的模型更快。
不过,Hy3 目前来说也有两个挑战。
第一,腾讯 AI 产品线太多,模型能力需要被一个清晰入口承接。 Hy3 接入越多业务越好,但如果每个产品都各自讲一套 AI 故事,用户感知反而会分散。元宝、ima、WorkBuddy、CodeBuddy、Marvis、QQ 浏览器之间,需要形成更清楚的分工,否则容易变成“内部能力很强,外部品牌感不强”。
第二,官方数据还需要更多第三方和真实开发者验证。 目前很多提升数据来自官方或媒体稿,例如 Marvis 任务完成率、ima 稳定性、微信公众号意图识别、WeGame 游戏助手成功率等,说明方向很好,但最终口碑还是要看开发者和普通用户长期使用后的反馈。
如果后续腾讯能把 Hy3 和元宝、ima、WorkBuddy、CodeBuddy、微信生态、游戏生态真正打通,它的价值就不只是一个模型发布,而是腾讯 AI 体系进入“模型—产品—数据—反馈—再训练”的闭环阶段。
常规测试Q1:总结内容,生成知识卡片网页
总结这个网页(https://hy.tencent.com/research/hy3),生成一个好看,精致的知识卡片网页内容
整体的效果确实还不错的,它可以快速的对网页进行总结,然后把要点提取出来,最后生成的网页卡可以进行互动和点击

Q2:3D地球绘画
使用Three.js和JavaScript构建一个网页,创建一个基于数组的 3D 世界,展示我去过的地方。点击 3D 地球上的标记将触发缩放动画效果,并打开带有照片的详细旅行信息。
这是最新模型渲染出来的3D地球,感觉效果很惊艳,把整个地球都完美的展示出来

要知道之前的预览版的时候,生成的3D地球是没有具体的地球渲染的,这一点真的强了很多

Q3:开发一个“微旅程”网站,每天推荐一张世界小众角落的照片+一段故事。
一下子就能够给我把网站给整出来了。HY3的Agent能力增强了很多,它能够快速的生成对应的图片,然后进行网页制作

Q4:手工咖啡烘焙坊的网页设计
手工咖啡烘焙坊的网页设计。触感与手工美学。首屏区域采用分屏设计,展示咖啡豆和冒着热气咖啡杯的微距镜头。使用'纸张纹理'背景和手绘植物插图。字体混合使用复古粗衬线字体和现代简洁无衬线字体。配色方案:'烘焙棕褐色'、'奶油拿铁色'和'森林绿'。每款产品配有交互式风味轮廓图。有机、温暖、感官化.



页面完成度很高,而且配色也符合基本的要求
游戏代码编写测试Q1:用 Three.js 实现一款3D战斗机对战游戏,在城市上方飞行,可以用触屏或者键盘操控。

建筑用了一些方块进行构建,这个游戏可以直接玩。如果能够再优化一下效果还是可以的。
Q2:用 Three.js 实现一款愤怒的小鸟3D游戏
游戏界面很简单,而且游戏还是不太能够玩

我自己本身有一些分类模型的效果测试。于是我就让HY3做一下我这个项目的效果。在整体的任务执行上(分类任务),HY3仅次于GLM-5.2。

而且性价比很高,它的消耗时间很短,也基本和GLM-5.2差不多

还统计了一下token的消耗 与 得分情况,处于绿色区间的是比较优秀的效果,HY3和DS-V4能够比较优秀的完成分类任务

所以从我体感上看,HY3对于那种偏向于Agent级别的任务,效果还是可以的,能够在比较少消耗token的情况下完成任务。但是对于那种偏向于细节型的任务,还有优化的控件。
写在最后整体来看,Hy3 正式版相比 preview 进步很明显。它在综合能力强、价格低、速度快,尤其适合 Agent、网页生成、办公生产力和分类任务这类真实场景。
从测试体感看,Hy3 已经从“能用”变成了“挺好用”。网页设计、知识卡片、前端生成、Agent 执行类任务完成度都不错,很多结果已经接近“稍微改改就能用”的状态。
当然,它也不是没有短板。复杂游戏开发、长链路工程、顶尖数学推理、真实代码修复等任务,和 Claude、GPT、GLM 这类顶级模型相比还有差距。
但 Hy3 最大的优势在于腾讯自己的场景。微信、QQ、游戏、浏览器、办公、代码、知识管理,这些业务都可以持续给模型提供真实反馈。如果后续腾讯能把元宝、ima、WorkBuddy、CodeBuddy 和微信、游戏生态打通,Hy3 的价值就不只是一个模型,而是一个“模型—产品—数据—反馈”的闭环。







