Token导航 LogoToken导航

SpaceXAI发布Grok 4.7 跑分强实测反馈分化

更新时间 2026-09-22来源 第一财经正文 1737字阅读约 6分钟3 张图片

图片

在头部大模型几乎迭代一轮后,马斯克的SpaceXAI终于也跟着“交卷”了。

北京时间9月22日,SpaceXAI正式发布新模型Grok 4.7,官方称这是目前旗下功能最强大的编程和知识处理模型。马斯克转发跟帖称“Grok 4.7 是智能、速度和低成本的强大组合”。

图片

不过,从首批评测和用户反馈来看,Grok 4.7更像是一次补齐短板的追赶,而非全面领先的代际跃升。它在长时程智能体任务和编程测试中进步明显,但在网页、3D场景和可视化编程等实测中,也出现了不少“跑分很强、落地翻车”的样本。

根据AI评测机构Artificial Analysis的数据,Grok 4.7在智能指数上得分46,位列模型榜单第六,也让SpaceXAI进入全球排名前四的AI实验室之列。

官方在博客提到,Grok 4.7能更长时间地处理复杂任务,更仔细地检查自身运行结果,并配备了最完善的安全保障措施。“速度是同类模型的两倍,价格却只有一半。”

与Grok 4.6相比,Grok 4.7 使用了更大更新的基础模型,经过更长时间的强化学习训练,任务组合也更加复杂,尤其侧重于那些需要花费数小时才能完成的问题。因此,这一模型在验证自身工作和处理更长的上下文方面表现更佳。

从评测结果看,这次升级最明显的进步集中在智能体和编程场景。

Artificial Analysis发文提到,在AA-Briefcase这一长时程智能体知识工作基准中,Grok 4.7仅落后于Claude Opus 5和Claude Fable 5.1。该测试模拟数据分析、产品管理和企业战略等真实工作,需要模型处理大量文件,并最终交付文档、表格或演示文稿,比单轮问答更接近AI进入办公室后的实际任务。

编程能力也有明显提升。Grok 4.7搭配官方编程智能体Grok Build,在Artificial Analysis编程智能体指数中得分56,在各家模型搭配原生智能体工具的测试中,它排名第四,仅落后于Claude Fable 5.1、GPT-6 Astra和Claude Opus 5。

在价格上,Grok 4.7标准版为每百万输入token 2 美元、每百万输出token 6 美元,与 Grok 4.6 保持一致。官方还会提供速度更快的一版模型,其输出速度是标准版的两倍,价格也相应翻倍。

单看价格,Grok 4.7在前沿模型中确实不贵,但低单价并不必然等于低总成本,因为它完成任务时消耗的token更多。

Artificial Analysis的测试显示,Grok 4.7每个智能指数任务使用约 8.1万输出token,而 Grok 4.6为3.6万,GPT-6 Astra为2.7万 token,分别高出了125%和196%。

对于按量付费的开发者而言,真正需要比较的是完成同一项任务要花多少钱、等待多久,这还需要进一步的任务实测。

根据首批用户的案例测试,在网页、3D场景和可视化编程上,Grok 4.7的结果并不稳定。有用户对比Grok 4.7与Kimi 3在3D和前端任务上的表现,称Grok不仅生成效果翻车,消耗成本也达到后者的约三倍;在经典的“鹈鹕骑自行车”SVG网页动画测试中,它对角色与自行车运动关系的处理同样不及预期。

图片

当然,少数提示词和单次测试不能代表模型的全部能力。生成效果还会受到推理档位、智能体工具、上下文长度以及测试环境影响。但这些案例至少说明,基准测试中的领先并不会转化为所有场景下的稳定体验。

也有支持马斯克的网友站出来评论道,外界对Grok 4.7的期待被抬得过高。马斯克此前给出的参照是,Grok 4.7整体能力大致与Claude Opus 5相当,在不同任务上互有胜负。按照马斯克此前的表态,真正的改进将在下一代4.8中实现,而Grok 4.9更可能达到Anthropic的Mythos级别。

或许正是由于效果达不到预期,Grok 4.7的发布此前几度延期。早在7月,马斯克便开始预告新模型,8月称“再等几周”,月初延期后他表示还需等待和调校。

在4.7发布前,马斯克已经开始预热下一代了。9月14日,马斯克称,Grok 4.8是一款参数量达2.5万亿的AI模型,并且会在当周完成训练、启动强化学习。

对SpaceXAI来说,坐拥顶级资源,最新模型却没有排进前三,或许还是得在下一代模型上努力一下。

(本文来自第一财经)
文章标签GrokxAI大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多