刚刚,日本 AI 公司 Sakana AI 发布了 Fugu,一个把多 Agent 编排系统包装成单一模型 API 的产品。
在官方公告中,其号称性能对标 Fable 5 和 Mythos Preview。

不过需要注意的是,这并不是又一个「更大更猛的单体模型」,而是一种完全不同的思路:Sakana 训练的是一个去调度其他模型的模型。
下面是 Sakana 给出的媲美 Fable 和 Mythos 的成绩:

Benchmark | Fugu | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|---|
SWE Bench Pro | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
HLE | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
TerminalBench 2.1 | — | 82.1 | — | — | — |
SWE Bench Pro 上 Fugu Ultra 拿到了 73.7,超过了 Opus 4.8 的 69.2。
GPQA-D(研究生级别科学问答)上达到 95.5,是目前公开可用模型中的最高分。
HLE(Humanity's Last Exam)上拿到了 50.0,略微超过 Opus 4.8 的 49.8。
Sakana 自己说的是:
01“ Fugu Ultra 与 Fable 5 和 Mythos Preview 站在同一水平线上。”
Fugu 是什么?
Sakana Fugu 本身是一个 LLM,但它并不直接回答你的问题,它的工作是决定让谁来回答。

它背后维护着一个 Agent 池,里面包含各种专长不同的模型。
当一个任务进来,Fugu 会动态地决定:调哪个模型、分几步完成、要不要验证结果、要不要递归调用自己。

整个过程对用户来说是无感的,你调的是一个 API,拿到的是一个结果,中间过程发生了什么,你并不需要知道。
Fugu 有两个版本:
Fugu:平衡性能和延迟,适合日常编码、代码审查、交互式场景。
Fugu Ultra:优化答案质量,调用更深层的专家 Agent 池,适合高难度问题。
02技术原理
这套系统的协调策略没有任何手工设计,全是学出来的。

Fugu 的研究基础来自两篇 ICLR 2026 论文:
TRINITY 提出了一个轻量级的「进化协调器」,自适应地给不同任务分配 Thinker(思考者)、Worker(执行者)、Verifier(验证者)三种角色。协调器本身通过进化算法优化,不依赖人工设定规则。

另一篇 Conductor 则通过强化学习训练出一个「指挥家」,让它自己发现最优的 Agent 通信模式和协作策略。
论文的核心发现是:RL 训练出来的协调策略往往是「非直觉但高效」的,人类设计师不太会想到那种分工方式。

Fugu 跟写死的 pipeline 完全不同,它是一个学会了怎么当项目经理的 LLM。它会动态地从模型池中组装团队,并通过非显而易见但高效的协作模式来协调它们,最终完成任务。
03六个实战案例
Sakana 展示了六个实战案例:

在 AutoResearch(自动化 ML 研究)任务中,Fugu Ultra 自主运行了 123 次实验,拿到了最优的 BPB 得分(0.9774 ± 0.0019),超过所有 frontier 竞争者。
日文古籍识别方面,Fugu 在处理日本历史文献的阅读顺序恢复时达到 NED 0.80,而竞品模型只有 0.24 或直接失败。
不过……这大概和 Sakana 的日本基因有关,其他家估计没空专门去研究日本古籍了。
魔方求解器上,Fugu 生成的代码成功解出了全部 300 个测试魔方,而竞品生成的代码则无法正常运行。并且 Fugu 在 300 个测试案例中,解法步数从未输过(7 胜 293 平 0 负)。
在 CAD 机械设计任务中,Fugu 设计了一个可工作的虹膜机构,其他模型产出的设计则存在间隙或不完整。
其他的,盲棋连续四局对弈中 Fugu 保持着完美的准确率;在股票交易 50 周的回测中 Fugu 实现了 +19.43% 的平均回报,其他 frontier 模型则均低于 15%。
04价格
目前提供订阅制和按量计费两种方式:
订阅(同时包含 Fugu 和 Fugu Ultra):
Standard:$20/月
Pro:$100/月(10 倍 Standard 额度)
Max:$200/月(20 倍 Standard 额度)
2026 年 7 月前订阅可免费获得第二个月。
按量计费(Fugu Ultra,fugu-ultra-20260615):
输入:$5/1M tokens(超过 272K 上下文时 $10)
输出:$30/1M tokens(超过 272K 上下文时 $45)
缓存输入:$0.50/1M tokens

作为对比,Opus 4.8 的价格是 $15 输入 / $75 输出。Fugu Ultra 的输入价格只有 Opus 的三分之一,输出价格不到一半。
Fugu 兼容 OpenAI 的 API 格式,不需要独家 SDK,你直接改个 endpoint 就可以使用了。
05无出口管制风险
或许是为了讽刺 A 社,Sakana 在发布中反复强调一个点是:frontier capability without the risk of export controls。
没有出口管制风险。
随着 AI 监管收紧,依赖单一供应商的风险越来越大。如果某天因为政策或法规限制,某个 frontier 模型在你所在的地区不可用了怎么办?

Fugu 的编排架构天然具有弹性,它可以在底层切换不同的模型。虽然性能可能会有所下降,但不大会从 frontier 直接掉到不可用。

开发者 Chris 在使用后表示:
“ 如果是一个干净的单次 prompt,你大概还是会直接用 Fable 5 或 Mythos。但任务越复杂、越混乱——涉及分工、验证、综合、代码审查、研究循环、安全评估——这种编排系统就越有意义。”

甚至,已经有人火速开源了一个用 TypeScript 实现的简化版 Fugu runtime,用 DSPy 风格的 Agent 框架复刻了 Conductor 的核心模式:指挥、分工、上下文传递、验证和综合。
06可用性
Fugu 目前全球可用,但欧盟/欧洲经济区暂不支持(GDPR 合规还在进行中)。
用户可以在 Fugu 版本中选择退出特定的底层模型,但 Fugu Ultra 的 Agent 池是固定的,不支持自定义。
数据使用方面,用户数据默认用于性能改进,但可以随时在控制台中关闭。
不过,至于具体使用了哪些底层模型,Sakana 表示,路由信息属于专有技术,不便对外公开……
◇ ◆ ◇
产品页面:https://sakana.ai/fugu/
技术博客:https://sakana.ai/fugu-release/
注册使用:https://console.sakana.ai/login
推文:https://x.com/SakanaAILabs/status/2068861630327443966







