Token导航 LogoToken导航

Grok 4.7 上线:官方测试 38% 独立测试 26%

更新时间 2026-09-23来源 Aike正文 1507字阅读约 5分钟3 张图片

为这一版模型,马斯克前后改过至少五次时间表。7 月底说"四周后",接着变成"几周""三到四周",9 月 1 日缩到"十天",9 月 11 日又说"还得再炖几天"。

9 月 21 日周一下午,Grok 4.7 上线,这次没有等待名单。

规格确实涨了。总参数 2.1 万亿,比 8 月 12 日的 Grok 4.6 多出 40%。上下文窗口仍是 50 万 token,在各家前沿模型里属于偏小的一档。价格一分没动,每百万输入 2 美元、输出 6 美元,缓存命中 0.5 美元,提示词超过 20 万 token 后翻倍计价。

上线当天就铺开了:Grok 应用、Cursor、自家的命令行工具 Grok Build、xAI API,还有 GitHub Copilot。之后是 OpenRouter、Devin、Cline、Vercel AI Gateway 这些渠道。渠道铺得很快,没有企业名单排队这一环。

01 官方那组数字:难题上多待一会儿

官方模型卡给的提升集中在工程任务上。Terminal-Bench 4.0 从 20.3% 到 38.0%,涨了 17.7 个点;CursorBench 4.0 从 40.4% 到 46.3%;DeepSWE v1.1 从 65.2% 到 71.0%;硬件工程基准 EEBench 从 53.0% 到 64.0%。

官方给的解释是训练方式换了:更长的强化学习、更难的任务分布,模型在难题上愿意花更久,也更频繁回头检查自己的答案。换成大白话,它不再急着交卷。

图片

02 独立那组数字:同一项测试测出 26%

Artificial Analysis 测出来的不一样。综合智能指数 46 分,比 Grok 4.6 高 2 分,刚好把它送进前四家实验室,但排在 Fable 5.1 Max、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol Max 后面。

最能说明落差的是 Terminal-Bench。官方口径 38.0%,AA 在 xHigh 档只测到约 26%;同一档位,GPT-6 Astra 是 59.6%,Opus 5 在最高档约 49%。同一项测试、同一个模型,两组数字差出十多个点。有开发者看完直接说这个成绩糟透了。

涨了 17.7 个点是真的,但绝对值还不到对手的一半。

知识工作类也没翻盘。GDPval 拿 1695,输给 Fable 5.1 的 1735;AA-Briefcase 是 1657,对手 1678。两项都排在前面那位后面。

图片

03 标价没动,单任务的账变了

真正要掏钱的人该盯的是输出长度。AA 测出它每完成一个智能指数任务平均吐 8.1 万 token,Grok 4.6 是 3.6 万,GPT-6 Astra 是 2.7 万。比上一代多 125%,比 Astra 多 196%。

每百万 token 的单价没变,单个任务的账单却变了。只看标价选模型的习惯,到了多步任务里越来越不准。

图片

04 别人抄不走的那部分

有一处优势别家补不上。这次训练补进了 SpaceX 体系的工程数据,包括星链卫星遥测、制造记录和工程故障日志。这类数据不在互联网语料里,目标是让模型理解硬件怎么坏,而不是教科书怎么说。

安全上,官方称这是自家护栏最强的一版:LatchBio 生物安全基准拿到 62.4% 居首,HackerBench v0.3 只放行 3.3% 的高风险双用途请求,同时尽量不误拦正常的安全工作。

这句话发出来的时间点有点巧。Dario Amodei 那篇主张放缓的文章过了 9 天,苏格兰那场把英伟达、谷歌 DeepMind、Anthropic 请到一张桌上的会过了 4 天,马斯克没有出席。

路线图也一并给了:Grok 4.8 即将完成训练,4.9 对标 Astra 和 Fable 那一档,Grok 5 瞄准通用人工智能。

xAI 的赌注一直没变,用够好、便宜、到处都能用,去吃日常用量,而不是在每个榜单上抢头名。这版恰好把这个赌注的风险摆了出来:它确实更强,也确实更贵,只是贵在看不见的地方。

文章标签GrokxAI模型发布
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多