Mindverse(心洲科技)最近开源了一个 749B 参数的 Agent 模型 Macaron-V1-Preview,训练用的算力,不到 300 张卡。
这 300 张卡里,大部分还不是英伟达的先进芯片。
放到今天这个大厂动辄几千上万卡的时代,这个数字不到主流万亿参数厂商的 1%。这就好比……别人开着集装箱船运货,而你只是骑了辆三轮车,但同样也到达了目的地。

与此同时,Mindverse(心洲科技)完成了由美团战投领投的 A 轮融资,元禾璞华、韶音科技和老股东追加跟投,总融资额近 5,000 万美元。历史股东包括蚂蚁、红杉、高榕和真格等一线基金。
团队核心研发约 20 人,成员来自 DeepSeek、字节 Seed、xAI,也有清华、MIT、杜克的背景。

你可能会想:他们是怎么做到的呢?答案藏在一个朴素的选择之中:
2023 年,Mindverse(心洲科技)的联合创始人 Andrew 和姚顺雨合作发表了 FireAct 论文,提出了一个当时还算非共识的判断:
三年前说出这句话,大多数人应该不太苟同。那时 Agent 的主流思路是靠 prompt 和框架,LangChain、ReAct、各种 Agent 框架层出不穷,大家默认基座模型够强就行,剩下的……交给工程即可。
但后来,大家也都看到了。
DeepSeek 发布 R1 之后,强化学习在后训练中的威力第一次被行业系统性地认识到了。从那以后,后训练的地位一路攀升,越来越多人意识到 Agent 的能力确实得从训练里来,光靠 prompt 是拼不出真正可靠的智能体的。
而选择 LoRA 作为核心路线,一开始其实是被逼出来的。创始人陈锴杰回忆:
LoRA 是一种参数高效微调方法,简单来说就是不动整个大模型的权重,只训其中一小组关键参数。用很少的算力,就能拟合出接近全参数训练的效果。
团队在这一方面的实践路线如下:

有趣的是,当时他们的第一反应是……怀疑是不是有 bug。直到 Thinking Machines Lab 独立印证了同一结论,他们才感觉,踏实了。
LoRA 在 Mindverse 手里,已经不只是一个省算力的微调工具了。
打个比方,大模型底座就像一个很聪明的脑子,LoRA 则是挂在上面的一个个轻量「技能包」。每个技能包只占基模参数量的千分之几,但能独立更新、彼此隔离,承载特定的能力和记忆。

这套架构叫 Mixture-of-LoRA。
不同能力分别训练成独立的 LoRA,同时部署在同一个基模上,运行时通过一个 router 工具实时切换最优组合。
比如服务一个金融客户,可以分头训一个学股价的、一个学财报的、一个学风控的。三个月后市场变了、新数据来了,也不用重训整个模型,继续训那个对应的 LoRA 就行。旧的能力一点不受影响,新的直接累加上去。
这和传统做法的差异在于,传统思路是把所有能力合并训进一个大模型,每次加新东西都有把旧本事弄丢的风险。而 Mixture-of-LoRA 的能力一块一块累加,互不干扰,天然适合持续学习。

在这个过程中,他们还发现了一条 Scaling Law:

挂上去的模型越多,整体智能也越能稳步地往上走。
这条 Scaling Law 在他们的论文「On the Scaling of PEFT」中有详细阐述。论文提出了 PEFT 的三个扩展轴:
rank 从 16 压到 1
但要让上百万个 LoRA 能同时管理、快速激活,光有模型还不够。Mindverse(心洲科技)为此构建了 MinT,一套专为 LoRA 训练和在线服务打造的托管基础设施。

MinT 将 DeepSeek V4 的三层缓存机制扩展为四层,通过打包 MoE LoRA 张量,把引擎的实时加载速度提升了 8.5 到 8.7 倍。从训练完成到推理服务可用的交接时间,最多缩短到了原来的十八分之一。
一个请求进来,即使命中了一个还没激活的 LoRA,也能在一秒内完成响应。
目前这整个系统,已经可以支撑百万量级的 LoRA 策略寻址。
基于这套体系训出来的模型叫 Macaron-V1-Preview,750B 参数(744B GLM5.1 底座 + 5B LoRA)。
Mindverse 也是首个基于 GLM5.1 完成强化学习后训练的外部团队。这件事有着非常扎实的工程门槛:需要适配 GLM5.1 的 DSA 稀疏注意力和 MTP 多 token 预测架构,每一项在万亿参数规模上都是硬骨头。

这个模型的特点在于:

而 LivingBench 的设计思路本身,也很是值得一说。
它构建了一个包含动态噪声、动态生活环境和动态用户反应的拟真沙盒,模拟真实生活中的各种突发:餐厅突然没座、路线因天气变化、用户临时改预算、不同 App 查到的信息还互相矛盾……甚至有些生活中非常离谱的案例。
模型需要的是,能持续理解用户、核对信息、调整计划,在用户耐心有限的情况下把事情办好。
这和姚顺雨在「智能下半场」中的观点是一致的:
——姚顺雨「智能下半场」
而在通用 Agent 任务上,比如 Tau3、SWE-bench Verified、Terminal2,Macaron-V1-Preview 也接近了前沿开源模型甚至海外闭源模型的水平,没有因为生活类优化而大幅牺牲通用能力。
Mind Lab 负责人马骁腾表示:
只看模型参数和 benchmark 分数,会漏掉 Mind Lab 这套东西最关键的一层。
Macaron-V1-Preview 不是一个孤立的模型,它和 Agent Harness 是一起训练、评估和部署的。
Agent Harness 可以理解为模型运行时的执行环境:工具调用、多步任务轨迹管理、生成式 UI 渲染、用户反馈收集、路由机制、缓存调度、任务状态管理,以及产品侧的真实交互界面的一整套系统。
大多数团队的做法是:先训好一个模型,再把它接进产品系统里。训练环境和上线环境是两套东西,中间多少存在落差——训练时表现很好的能力,部署后效果打折扣,是行业常态。
Mind Lab 的做法不同。模型在训练阶段就接触真实的 Agent 轨迹和工具调用环境。训练环境和部署环境是同一套。中间没有翻译层,没有落差。
但真正让这套体系有壁垒潜力的,是后面那个循环。
真实用户的反馈会回流到后训练中,形成一个循环:产品使用 → 收集反馈 → 优化模型 → 更新产品。
这意味着,跑得越久、用户越多,模型见过的真实场景就越丰富,对边缘情况的处理能力就越强。而这些数据和经验,是后来者很难直接复制的。
这个逻辑和 Anthropic 的 Claude + Claude Code 其实是同一条路,只是 Mindverse(心洲科技)的场景放在了衣食住行上。
这可能是比任何单一 benchmark 成绩都更值得关注的东西:一个从产品到模型再到产品的闭环,如果真的转起来,就不只是技术优势,而是一种结构性的壁垒。
在这个体系里,还有两个技术组件需要细说一下。

传统的 AI 记忆做法,本质上是在模型旁边挂了一个不断变长的记事本。
刚开始用着还行,但这个记事本只增不减,越来越厚,模型每次能「读进脑子」的篇幅却是有限的。用久了,命中你当下需要的那条信息的概率反而越低,到某个临界点……体验开始往下掉了。
δ-mem 走了另一条路。
用一个仅 8×8 的在线记忆状态,参数增加只有 0.12%,就能在重度记忆基准测试上把性能提升到 1.31 倍。即使移除了显式的历史上下文,模型依然能恢复出大量相关信息。
这是 Mindverse(心洲科技)对长期记忆的核心判断。
在他们的体系中,每个 LoRA 都可以作为持久的自适应状态,承载特定用户的偏好、记忆和行为边界,把统一的共享模型变成专属的「个人模型」。

你问 AI「今天吃什么」,传统做法是回你三百字推荐。
Macaron-A2UI 的做法是直接弹出几个可点的选项卡、一个价格滑块、一个确认按钮。用户在界面上操作就好,不用来回打字。
在极轻量的 Schema 提示下,Macaron-A2UI-235B 在 A2UI-Bench 上拿到了 75.6 分。同场景下,最强前沿模型需要喂进长 27 倍的完整 Schema,分数反而……还不如它。
这也说明,UI 生成能力确实可以通过高效微调后内化到模型权重中,而不需要在每次推理时塞进一大段 Schema 说明书。
Mindverse(心洲科技)这个故事里,还有一条线索是:开源生态。
团队坦言相关突破离不开与字节 verl 团队、英伟达 Megatron-Bridge、伯克利 vllm 等社区的合作。
在国内两个主要的强化学习框架中,团队和蚂蚁、华为一起构建了 AReaL-MinT,和字节一起构建了 verl-mint,LoRA 技术都被整合了进去。
英伟达也把他们挂到了官网首页。
Mindverse(心洲科技)也把自己的基础设施在字节 verl-project 中做了开源(verl-mint),而不是偷偷藏了起来。

这其实也是 Mind Lab 值得观察的地方:算力约束本身,倒逼出了一条更高效的后训练技术路线;而开源协作的生态,又让这条路线在基础设施层面变得可行。
团队设想的终局图景是:少数几个强大的基础模型,支撑起海量个性化的轻量 Adapter。
每个人、每个企业都有一片属于自己的参数空间,承载独立的记忆、偏好和能力边界,同时共享同一个聪明的底座。
当然,这条路最终能走多远,可能还要再观察一段时间。
但有一件已经发生了的事是:用不到大厂 1% 的算力,把一个 749B 的 Agent 模型训了出来,在生活场景上打出了开源模型Sota,背后还跑通了一套从产品到模型的完整闭环。
不管你怎么评估这家公司的终局,很难否认的一点是:在大模型行业高度同质化的今天,Mindverse (心洲科技)选了一条不一样的路,而且在极其有限的条件下,把这条路的第一公里跑完了。
第一公里之后的路,才是真正的考验。但至少现在,它已经有资格让人认真看一眼了。







