Token导航 LogoToken导航TokenDH.com

做出ChatGPT核心研究的人今天掀桌:大模型搞不定自动化,新架构提速200倍且输出免费

更新时间 2026-09-16来源 AI寒武纪正文 2602字阅读约 9分钟5 张图片
图片

语言模型聊天能力超越人类好几年了,可真正的业务自动化到底卡在哪里?

这是前 OpenAI 研究员、ChatGPT 背后核心方法开发者 Diogo Almeida 琢磨了四年的问题。

图片

当年他参与打造了让大语言模型听懂指令并与人顺畅对话的技术。

但在热潮退去后,他意识到基于聊天的模型少了一块极其关键的拼图。

隐身研发两年后,他创立的 TypeSafe AI 正式发布首个 System One 模型:Jev。

这是一个专为自动化设计的全新前沿模型。

它不做逐字生成,直接输出软件能直接消费的结构化决策。

Jev 放弃了长文本生成。

换来的回报非常夸张:

速度提升两个数量级。

输出完全免费。

从数学层面根除类型错误与幻觉。

一句话概括:给它一段无结构的状态输入,它直接返回带概率置信度的强类型决策。

两代前沿模型对比

传统大模型与 Jev 的底层设计完全不同:

优化算法

传统大模型采用人类反馈强化学习(RLHF)或可验证奖励强化学习(RLVR)。

Jev 采用专为校准决策设计的强化学习(RLCD)。

优化目标

传统大模型优化人类偏好或可自动验证的答案。

Jev 优化决策校准度,在判断任务中给出真实可信的概率。

输入格式

传统大模型偏重连续对话消息。

Jev 偏重结构化的程序状态。

输出格式

传统大模型输出自由字符串。需要解析验证,随时可能格式错乱或胡说八道。

Jev 输出强类型结构化数值。可能的结果提前定义好,永远不会出现类型错误,每个答案自带置信度。

采样方式

传统大模型自回归单字生成,一个 Token 接着一个 Token 往外蹦。

Jev 并行采样,单次查询直接返回所有输出,极度契合硬件加速。

调用成本

传统大模型输入每百万 Token 价格在 0.2 美元到 10 美元之间,输出通常贵 5 倍。

Jev 输入每百万 Token 仅需 0.042 美元(折合 10 亿 Token 只要 42 美元),输出完全免费。

响应速度

传统大模型端到端需要 3 秒到 329 秒。

Jev 端到端仅需 70 毫秒到 500 毫秒,快了 40 倍到 200 倍。

置信度表现

传统大模型容易过度自信且飘忽不定。

Jev 严格校准,置信度越高代表准确率越高,相似输入结果高度一致。

适用场景

传统大模型擅长聊天、辅助编程、原型演示等有人类把关的任务。

Jev 适合嵌入常规软件当做智能判断分支,搞定分类、路由、评分、大批量数据 Map-Reduce 分析、实时系统以及给大模型做安全护栏。

实测数据与细节公开

团队公布了多项对比验证,并公开了所有测试细节。

1. 实时并排对比

Jev 接收输入后瞬间并行返回所有概率,而对比的 GPT-5.6 Terra 还在逐字推理输出。

针对这次测试,团队公开了以下细节:

测试输入是一段简短密集的段落,这种短输入更有利于展示 Jev 的并行采样优势。

测试选用默认推理模式的 GPT-5.6 Terra,因为它的平均智能水平与 Jev 最接近。

在实际运行中,Jev 和 GPT-5.6 Terra 唯一的判断分歧在用户流失概率等级上,这段文本本身确实存在歧义。

2. 真实工作流评估

为了测试模型在真实代码逻辑里的表现,团队设计了一套全新的测试方法。
不测公认的标准答案,给所有模型套入相同的生产级业务工作流代码,拿 GPT-6 Astra 和 Fable 5.1 两个大模型的平均判断做基准。

图片

在 4 个实际业务工作流测试中,Jev 占据了帕累托最优前沿,准确率达到约 68%,成本比 OpenAI、Anthropic、Google 等主流模型便宜了 100 倍到 1000 倍。

图片

这是 4 个工作流中最简单的一个:分流、处置、遏制、剧本。

包含大量独立解耦的问题与细粒度概率分支。

针对测试,团队补充说明:

主页宣传的提速 193.6 倍、降本 444.6 倍来自该测试,属于现实收益的上限水平。

工作流由内部能力团队编写,不排除存在潜在偏好。

参考标准采用了 OpenAI 和 Anthropic 的模型均值,可能低估了 DeepSeek 等模型以及 Jev 的相对表现。

对比的大模型均使用了团队开源的 System One LLM 适配层,虽然限制了大模型输出规范,但这也让大模型的调用成本进一步上升。

3. 彻底杜绝幻觉与类型错误

图片

现存大模型在 OpenRouter 上的统计数据显示:

结构化输出错误率在 0.58% 到 45.5% 之间。

工具调用错误率在 0.7% 到 17.2% 之间。

Jev 在这两项指标上的错误率全为 0%。

因为 Jev 从底层直接锁死 Schema 模式匹配,从数学机制上杜绝了类型错误与幻觉。


试玩演示

毁灭战士 Doom

团队给 Doom 游戏接入了 Jev,每秒调用 10 次判断,每小时调用成本约 7 美元。

需要说明的是,当前测试输入给模型的是游戏的结构化文本状态数据,并非直接输入图像。

虽然专用非 AI 脚本可能打得更好,但该演示展示了模型极快的指令跟随与响应速度。

维基百科竞速 Wikiracing

规则是从一个维基百科词条出发,只靠点击页面内的链接跳到目标词条。
Jev 支持最高 255 个高基数选项。

面对极多链接时,系统采用两阶段处理:先独立打分再做明确选择。
在对比中,Jev 的跳跃步数明显更少。


名字以及研发背后

名字里的 System One 和 Jev 是什么意思?

名字来自丹尼尔·卡尼曼的《思考,快与慢》,指代人类快速直觉反应的系统 1。

Jev 名字取自经济学家威廉·斯坦利·杰文斯(杰文斯悖论)。蒸汽机效率提升没有减少煤炭消耗,反而引爆了总需求。算力成本每降一个数量级,就会激活成倍的自动化需求。

为什么要开发全新的训练算法?

以往的 RLHF 优化目标是让人类给文本点赞,这适合聊天,不适合严密的自动化。

RLVR 只能解决容易用代码判分的问题,真实世界的大量判断不具备这种特性。

训练目标决定模型形态,因此团队研发了 RLCD 算法。

Jev 算是一个更小的大语言模型吗?

Jev 既不是小模型,也不属于大语言模型,它是完全不同的结构。

为什么不刷公开跑分榜?

团队坚决不公布公开基准测试成绩。

公认跑分容易导致针对榜单刷分,甚至让模型能力失真。

团队建议开发者在自己的真实场景下建立评估集,即便在跑分上领先,也不去过度推崇榜单。

训练数据来自哪里?

TypeSafe 本质上是一家数据研究实验室,所有训练数据全部由团队自研构建,绝对不会拿用户的数据用于训练。

目前 Jev 已经开放早期预览申请。

source:

https://typesafe.ai/blog/introducing-system-one-models-and-jev

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签ChatGPTOpenAI大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多