Token导航 LogoToken导航

谷歌Gemini 4基准跑分亮眼实测编码表现遭内部质疑

更新时间 2026-10-01来源 搜狐科技正文 2030字阅读约 7分钟2 张图片
谷歌Gemini 4基准跑分亮眼实测编码表现遭内部质疑

Gemini 4发布遭内部质疑,基准测分亮眼,实际编码表现参差不齐。

,周三谷歌正式向外部发布Gemini 4 Argon,将其定位为公司长期研发的旗舰人工智能模型。

然而据彭博报道,尽管该模型在多项基准测试中斩获领先分数,部分有权限直接使用该模型的谷歌内部人员却对其实际表现持保留态度,尤其是在编码能力方面。

谷歌方面明确否认上述质疑,表示有关Gemini 4在编码等领域表现不佳的说法"不准确",并援引Google DeepMind负责人Koray Kavukcuoglu的表态为佐证。Kavukcuoglu上周在The Information主办的一场会议上表示:

我对团队有充分的信心,在我看来,我们始终处于前沿是板上钉钉的事。

面对OpenAI和Anthropic在模型与产品双线推进的竞争压力,Gemini 4能否在真实场景中兑现承诺,对谷歌的搜索、广告及云业务均具有直接影响。消息传出后,Alphabet盘后涨幅明显收窄。

内部分歧:基准佳绩难掩实际短板

据彭博援引知情人士,Gemini 4在业界通用基准测试中表现良好,但在员工实际使用中效果明显打折,尤其在编码任务上暴露出明显短板。

报道援引其中一名知情人士指出,该模型在前端设计领域能力欠缺,而前端设计直接决定应用程序和网站的视觉呈现与交互体验。

部分员工认为,Anthropic的Fable和OpenAI的Astra在能力迭代速度上已超过Gemini,Gemini 4即便发挥最佳也将在若干领域落后。

另一部分员工则认为,新模型已经追平业内顶尖水准。一名熟悉模型开发的谷歌员工对彭博表示,公司内部存在"广泛共识",认为Gemini 4属于前沿级别,并否认其在真实编码任务中存在困难。

此外,据报道援引知情人士透露,Gemini 4体量庞大。大体量模型通常意味着较高的推理成本,这将在谷歌持续加码资本支出的背景下,对公司利润率形成额外压力。

“过度优化”还是真实能力?

业内人士将上述现象归结为一种被称为“过度优化”(Benchmaxxing)的行业痼疾——即工程师更专注于在标准化测试中取得高分,而非打造真正好用的产品。

据彭博,两名熟悉Gemini 4的知情人士表示,该模型似乎受到这一问题的影响。AI初创公司Surge AI创始人Edwin Chen对此直言不讳:

打个比方,就好比说'我孩子SAT考了很高分'——但SAT成绩并不能转化为真实世界的表现。这是一个极其有害的问题。

AI实验室普遍面临这一困境,因为客户往往以基准分数作为评估模型优劣的主要依据,这在客观上推动了实验室将精力向"刷榜"倾斜。

值得注意的是,Gemini 4并非没有优势。据一名知情人士介绍,该模型在多模态任务上表现突出,例如从视频中提取元数据,在安全性和网络安全领域也具备竞争力。

谷歌称其在一项衡量安全技能的基准测试中超越了OpenAI的Astra模型。此外,该模型单次可生成最多100万个token,约合75万英文单词。

代价高昂的弯路:3.5 Pro折戟与人才流失

Gemini 4的发布背后,是一段代价不菲的研发弯路。

谷歌原计划于今年5月I/O大会后的6月推出Gemini 3.5 Pro,但该版本最终因未能达到内部目标而被放弃。

彭博资讯分析师Mandeep Singh估计,训练一个前沿模型的单次运算成本最高可达4亿美元,若叠加高薪AI研究人员的人力成本,实际支出将更为可观。

与此同时,谷歌在人才端也承受持续失血之痛。多名明星AI研究员相继离职,包括传奇工程师Jeff Dean、诺贝尔奖得主John Jumper,以及对当下AI浪潮奠基技术有重要贡献的Noam Shazeer。

今年8月,长期执掌谷歌AI研究的Demis Hassabis转任董事长,将DeepMind日常运营交棒给Kavukcuoglu。

去年11月,谷歌发布Gemini 3,广受好评,被普遍视为公司AI竞争力的一次重要转折。此后一系列进展的停滞与反复,令外界对其执行力产生质疑。

竞争窗口收窄:对手步步紧逼

Gemini 4面临的外部压力同样不容小觑。

谷歌最直接的风险在于:Gemini系列模型是搜索、地图、Gmail、Chrome等核心产品的技术底座,每款产品的用户规模均超过10亿。

一旦模型竞争力落后,竞争对手将获得更多时间,说服开发者、企业和消费者选择其平台作为未来搜索与软件的运行基础。

与此同时,OpenAI和Anthropic正加速从模型提供商向产品公司转型,包括推进AI编码代理等应用。据报道,Meta本月早些时候发布了其AI代理平台Muse,发布后迅速登顶应用下载榜。

谷歌方面表示,尽管其上一个Pro版本于今年2月发布,公司旗下AI产品仍实现增长,企业版Gemini、消费者聊天机器人应用及谷歌搜索AI模式的用户均在扩张,后两者用户总数已突破10亿。

谷歌强调,庞大的用户分发体系是公司相较部分竞争对手的显著优势。

然而,优势能否转化为AI时代的持续领先,仍取决于Gemini系列能否在真实应用场景中令用户信服。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多