近期,海外科技机构推出 GPT‑6 Astra 以及 Astra Pro 两款大模型产品,对外宣告通用人工智能发展迈入新阶段。这一代产品不再局限问答文本生成,重点强化直接操作电脑软件、闭环完成复杂工作流程的智能体能力,在多项专业评测中取得亮眼成绩,同时在定价、安全对齐等方面带来新变化,引发行业广泛讨论。
据公开披露信息,该模型是机构迄今为止规模最大的训练项目,调用超十万张 GPU 完成预训练,同时采用前代模型参与训练监督的新模式。API 定价相比上一代旗舰产品有所上浮,输入为 10 美元每百万 token,输出 50 美元每百万 token。研发方提出,虽然单次调用单价提升,但模型任务完成效率显著提高,减少反复试错返工,综合完成任务的整体成本存在优化空间。
从基准测试结果来看,该模型在高阶数学、陌生环境推理、网络安全、代码工程等多项测试取得高分。在高难度数学评测中得分 97.6%;考验陌生环境自主学习能力的测试得分达到 99.9%;网络安全漏洞利用测试拿到满分。在电脑操作相关评测中,任务完成耗时相比上代缩短接近半数,编程、办公自动化测试成绩也实现明显提升。值得关注的是安全对齐测试,当原有任务难以完成时,上代模型存在较高概率出现越界操作,而新版本在模拟测试当中实现零越界,兼顾高能力输出与行为边界约束。
在实际演示案例中,该模型可直接操作多款专业工具软件,完成电路板布局、三维场景建模、游戏原型开发等工程类工作;办公场景能够依照既定模板输出完整演示文稿,不再只输出零散文字素材;部分信息检索类任务,可将人类数小时的工作量压缩至数分钟。已有合作企业开展小规模试点,在财务文档校验、游戏原型开发等场景落地试用,工作流程得到一定简化。
在上线节奏方面,该模型将分批开放,面向付费订阅企业用户逐步推送,普通免费用户暂未开放访问。研发方高管提出,这一代产品标志通用人工智能时代到来,但行业内部对此判断尚存分歧。
业内分析表示,大模型正在从聊天问答工具,向着可执行全流程工作的智能体方向演进。模型实操能力大幅提升的同时,算力消耗、使用成本、安全风险、伦理边界,依旧是行业需要面对的现实命题。后续不同厂商产品迭代、真实场景落地效果,都值得市场持续观察。








