Token导航 LogoToken导航TokenDH.com

美团投了一家只有不到 300 张卡的 AI 公司

更新时间 2026-06-11来源 AGIHunt正文 5058字阅读约 16分钟12 张图片

Mindverse(心洲科技)最近开源了一个 749B 参数的 Agent 模型 Macaron-V1-Preview,训练用的算力,不到 300 张卡。

这 300 张卡里,大部分还不是英伟达的先进芯片。

放到今天这个大厂动辄几千上万卡的时代,这个数字不到主流万亿参数厂商的 1%。这就好比……别人开着集装箱船运货,而你只是骑了辆三轮车,但同样也到达了目的地。

300
张卡
749B
参数量
$50M
总融资额
20
核心研发
图片

与此同时,Mindverse(心洲科技)完成了由美团战投领投的 A 轮融资,元禾璞华、韶音科技和老股东追加跟投,总融资额近 5,000 万美元。历史股东包括蚂蚁、红杉、高榕和真格等一线基金。

团队核心研发约 20 人,成员来自 DeepSeek、字节 Seed、xAI,也有清华、MIT、杜克的背景。

图片

你可能会想:他们是怎么做到的呢?答案藏在一个朴素的选择之中:

跳过预训练,把所有筹码压在后训练上。
赌后训练

2023 年,Mindverse(心洲科技)的联合创始人 Andrew 和姚顺雨合作发表了 FireAct 论文,提出了一个当时还算非共识的判断:

Agent 的能力,最终要回到模型训练本身,而不是靠 prompt 和框架拼出来。

三年前说出这句话,大多数人应该不太苟同。那时 Agent 的主流思路是靠 prompt 和框架,LangChain、ReAct、各种 Agent 框架层出不穷,大家默认基座模型够强就行,剩下的……交给工程即可。

但后来,大家也都看到了。

DeepSeek 发布 R1 之后,强化学习在后训练中的威力第一次被行业系统性地认识到了。从那以后,后训练的地位一路攀升,越来越多人意识到 Agent 的能力确实得从训练里来,光靠 prompt 是拼不出真正可靠的智能体的。

而选择 LoRA 作为核心路线,一开始其实是被逼出来的。创始人陈锴杰回忆:

最初只有几十卡、一百卡的集群,我们必须把每一分算力的效率榨到极致。

LoRA 是一种参数高效微调方法,简单来说就是不动整个大模型的权重,只训其中一小组关键参数。用很少的算力,就能拟合出接近全参数训练的效果。

团队在这一方面的实践路线如下:

注:很多人对 LoRA 的印象可能停留在 Stable Diffusion 画图模型上(确实比较大众),但其实,它最早就是为语言模型设计的(2021 年微软提出),后来才被图片生成社区广泛采用,为众人所知的。
2025 年 9 月
发现在足够大的 MoE 模型上用 LoRA 做 RL,性能与全参数训练无差别。1/10 的成本,同样的效果。
独立验证
OpenAI 前 CTO 的 Thinking Machines Lab 在「LoRA Without Regret」中独立印证了同一结论。
2025 年 12 月
完成万亿参数 LoRA 强化学习,全球同期只有 2 家做到:Thinking Machines Lab 和 Mind Lab(Mindverse 的研究团队)。
图片
1 T 模型 LoRA RL 的训练曲线

有趣的是,当时他们的第一反应是……怀疑是不是有 bug。直到 Thinking Machines Lab 独立印证了同一结论,他们才感觉,踏实了。

技能包思路

LoRA 在 Mindverse 手里,已经不只是一个省算力的微调工具了。

打个比方,大模型底座就像一个很聪明的脑子,LoRA 则是挂在上面的一个个轻量「技能包」。每个技能包只占基模参数量的千分之几,但能独立更新、彼此隔离,承载特定的能力和记忆。

一个底座,挂上成千上万个技能包,一个模型就变成了成千上万个各有所长的模型。
Base Model    金融      医疗      法律      出行  Mixture-of-LoRA:一个底座,万千技能
图片

这套架构叫 Mixture-of-LoRA。

不同能力分别训练成独立的 LoRA,同时部署在同一个基模上,运行时通过一个 router 工具实时切换最优组合。

比如服务一个金融客户,可以分头训一个学股价的、一个学财报的、一个学风控的。三个月后市场变了、新数据来了,也不用重训整个模型,继续训那个对应的 LoRA 就行。旧的能力一点不受影响,新的直接累加上去。

这和传统做法的差异在于,传统思路是把所有能力合并训进一个大模型,每次加新东西都有把旧本事弄丢的风险。而 Mixture-of-LoRA 的能力一块一块累加,互不干扰,天然适合持续学习。

图片
全参数微调 vs LoRA merge vs MinT multi-LoRA

在这个过程中,他们还发现了一条 Scaling Law:

聚合不同 LoRA 轨迹的输出,准确率随模型数量呈对数增长(Accuracy ≈ a + b ln(k))。
图片

挂上去的模型越多,整体智能也越能稳步地往上走。

模型数量本身,成了一个新的 scaling 维度。

这条 Scaling Law 在他们的论文「On the Scaling of PEFT」中有详细阐述。论文提出了 PEFT 的三个扩展轴:

Scale Up
更强基模提供更大适配杠杆
Scale Down
单 LoRA 极致轻量
rank 从 16 压到 1
Scale Out
模型种群数量驱动智能提升

但要让上百万个 LoRA 能同时管理、快速激活,光有模型还不够。Mindverse(心洲科技)为此构建了 MinT,一套专为 LoRA 训练和在线服务打造的托管基础设施。

图片
8.5x
加载速度提升
1/18
交接时间缩短
10⁶
LoRA 策略寻址

MinT 将 DeepSeek V4 的三层缓存机制扩展为四层,通过打包 MoE LoRA 张量,把引擎的实时加载速度提升了 8.5 到 8.7 倍。从训练完成到推理服务可用的交接时间,最多缩短到了原来的十八分之一。

一个请求进来,即使命中了一个还没激活的 LoRA,也能在一秒内完成响应。

目前这整个系统,已经可以支撑百万量级的 LoRA 策略寻址。

成绩单

基于这套体系训出来的模型叫 Macaron-V1-Preview,750B 参数(744B GLM5.1 底座 + 5B LoRA)。

Mindverse 也是首个基于 GLM5.1 完成强化学习后训练的外部团队。这件事有着非常扎实的工程门槛:需要适配 GLM5.1 的 DSA 稀疏注意力和 MTP 多 token 预测架构,每一项在万亿参数规模上都是硬骨头。

图片

这个模型的特点在于:

它在生活类 Agent 场景上拿了领先成绩,但并不追求所有方向的第一。
LivingBench
开闭源最高
VitaBench
开闭源最高
A2UIBench
开闭源最高
PinchBench
媲美闭源最强
在 LivingBench(Mind Lab 自研的真实生活场景评测)、VitaBench 和 A2UIBench 上,达到了开闭源模型的最高分。在 PinchBench 上,展现了与最强闭源模型同等竞争力,同时成本优势明显。
图片

而 LivingBench 的设计思路本身,也很是值得一说。

它构建了一个包含动态噪声、动态生活环境和动态用户反应的拟真沙盒,模拟真实生活中的各种突发:餐厅突然没座、路线因天气变化、用户临时改预算、不同 App 查到的信息还互相矛盾……甚至有些生活中非常离谱的案例。

模型需要的是,能持续理解用户、核对信息、调整计划,在用户耐心有限的情况下把事情办好。

这和姚顺雨在「智能下半场」中的观点是一致的:

构造有意义的 Benchmark,可能是打造模型最重要的事。

——姚顺雨「智能下半场」

而在通用 Agent 任务上,比如 Tau3、SWE-bench Verified、Terminal2,Macaron-V1-Preview 也接近了前沿开源模型甚至海外闭源模型的水平,没有因为生活类优化而大幅牺牲通用能力。

Mind Lab 负责人马骁腾表示:

我们不为刷榜做研究,也不为创新而做研究。我们是在为了真实的场景、真实的用户、真实的价值而做研究,并在这个过程中大胆地创新。
不只是模型

只看模型参数和 benchmark 分数,会漏掉 Mind Lab 这套东西最关键的一层。

Macaron-V1-Preview 不是一个孤立的模型,它和 Agent Harness 是一起训练、评估和部署的。

Agent Harness 可以理解为模型运行时的执行环境:工具调用、多步任务轨迹管理、生成式 UI 渲染、用户反馈收集、路由机制、缓存调度、任务状态管理,以及产品侧的真实交互界面的一整套系统。

大多数团队的做法是:先训好一个模型,再把它接进产品系统里。训练环境和上线环境是两套东西,中间多少存在落差——训练时表现很好的能力,部署后效果打折扣,是行业常态。

Mind Lab 的做法不同。模型在训练阶段就接触真实的 Agent 轨迹和工具调用环境。训练环境和部署环境是同一套。中间没有翻译层,没有落差。

但真正让这套体系有壁垒潜力的,是后面那个循环。

真实用户的反馈会回流到后训练中,形成一个循环:产品使用 → 收集反馈 → 优化模型 → 更新产品。

这意味着,跑得越久、用户越多,模型见过的真实场景就越丰富,对边缘情况的处理能力就越强。而这些数据和经验,是后来者很难直接复制的。

这个逻辑和 Anthropic 的 Claude + Claude Code 其实是同一条路,只是 Mindverse(心洲科技)的场景放在了衣食住行上。

这可能是比任何单一 benchmark 成绩都更值得关注的东西:一个从产品到模型再到产品的闭环,如果真的转起来,就不只是技术优势,而是一种结构性的壁垒。

当然,飞轮能不能真正转起来,目前还没有第三方数据可以验证。但从架构设计上,这条路径确实是完整的。

在这个体系里,还有两个技术组件需要细说一下。

δ-mem:记忆训进参数
图片

传统的 AI 记忆做法,本质上是在模型旁边挂了一个不断变长的记事本。

刚开始用着还行,但这个记事本只增不减,越来越厚,模型每次能「读进脑子」的篇幅却是有限的。用久了,命中你当下需要的那条信息的概率反而越低,到某个临界点……体验开始往下掉了。

δ-mem 走了另一条路。

用一个仅 8×8 的在线记忆状态,参数增加只有 0.12%,就能在重度记忆基准测试上把性能提升到 1.31 倍。即使移除了显式的历史上下文,模型依然能恢复出大量相关信息。

记忆写进参数里,而不是挂在外面的本子上。

这是 Mindverse(心洲科技)对长期记忆的核心判断。

在他们的体系中,每个 LoRA 都可以作为持久的自适应状态,承载特定用户的偏好、记忆和行为边界,把统一的共享模型变成专属的「个人模型」。

Macaron-A2UI:模型会画界面
图片

你问 AI「今天吃什么」,传统做法是回你三百字推荐。

Macaron-A2UI 的做法是直接弹出几个可点的选项卡、一个价格滑块、一个确认按钮。用户在界面上操作就好,不用来回打字。

在极轻量的 Schema 提示下,Macaron-A2UI-235B 在 A2UI-Bench 上拿到了 75.6 分。同场景下,最强前沿模型需要喂进长 27 倍的完整 Schema,分数反而……还不如它。

这也说明,UI 生成能力确实可以通过高效微调后内化到模型权重中,而不需要在每次推理时塞进一大段 Schema 说明书。

开源生态

Mindverse(心洲科技)这个故事里,还有一条线索是:开源生态。

团队坦言相关突破离不开与字节 verl 团队、英伟达 Megatron-Bridge、伯克利 vllm 等社区的合作。

在国内两个主要的强化学习框架中,团队和蚂蚁、华为一起构建了 AReaL-MinT,和字节一起构建了 verl-mint,LoRA 技术都被整合了进去。

英伟达也把他们挂到了官网首页。

Mindverse(心洲科技)也把自己的基础设施在字节 verl-project 中做了开源(verl-mint),而不是偷偷藏了起来。

图片
MinT 论文入选 HuggingPapers 周榜 Top AI Papers
不到 300 张卡,开源社区帮你把有限的算力用到了极致。

这其实也是 Mind Lab 值得观察的地方:算力约束本身,倒逼出了一条更高效的后训练技术路线;而开源协作的生态,又让这条路线在基础设施层面变得可行。

团队设想的终局图景是:少数几个强大的基础模型,支撑起海量个性化的轻量 Adapter。

每个人、每个企业都有一片属于自己的参数空间,承载独立的记忆、偏好和能力边界,同时共享同一个聪明的底座。

当然,这条路最终能走多远,可能还要再观察一段时间。

但有一件已经发生了的事是:用不到大厂 1% 的算力,把一个 749B 的 Agent 模型训了出来,在生活场景上打出了开源模型Sota,背后还跑通了一套从产品到模型的完整闭环。

不管你怎么评估这家公司的终局,很难否认的一点是:在大模型行业高度同质化的今天,Mindverse (心洲科技)选了一条不一样的路,而且在极其有限的条件下,把这条路的第一公里跑完了。

第一公里之后的路,才是真正的考验。但至少现在,它已经有资格让人认真看一眼了。

Mind Lab 技术博客:https://macaron.im/mindlab
文章标签大模型学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多