早上到公司刷 GitHub ,发现了一个面壁智能、清华大学 THUNLP 实验室、OpenBMB 与 AI9stars 联合开发的 Agent 开源项目,理念特别有意思,产品名字叫 PilotDeck。
链接我放在这里,大家可以先看一下。
https://pilotdeck.openbmb.cn/pilotdeck.github.io/

这周是面壁智能的开源周。
前几天他们分别开源了端侧的大模型、训练方法,以及一整套由 AI 写出来的训练框架,基本把自己这几年在端侧 AI 上攒的底子,摊开给大家看了一遍。

没想到今天,他们居然开源了一个AgentOS。我估计很多人能用得着这个项目,所以想专门写篇文章给大家介绍下。
上周在深圳跟很多用户交流的时候,我发现一个需求被反复提到。
很多用户都问,有没有好的 Agent 开源项目,他们想私有化部署。我说有,Codex 的 CLI 不就是开源的吗,直接拿去用就行了。
后来聊下来我才慢慢明白,事情没这么简单。
很多公司因为数据安全的原因,没办法直接用第三方的 Agent 产品,只能做私有化部署。
而公司里用 Agent 的人,是所有同事,包括财务、法务、运营等等。这种情况下,CLI 就没那么合适了。CLI 还是得会用命令行才能搞明白。
也就是说,他们真正需要的,是一个足够傻瓜化的 Agent 开源产品。
当时我还真一下子没想到特别合适的方案。
结果也挺巧,今天早上就刷到了 PilotDeck 这个项目。
不知道是谁说过一句话,你心里一旦装着某个问题,那个问题的解法就会在某个时刻自己冒出来。这回大概就是这种感觉。
#01
介绍下这款开源项目的理念
现在很多 Agent,功能层面其实已经慢慢趋同了。
Skill、Computer Use、多 Agent、MCP,各种自动化工作流的能力,这些东西后面大家大概率都会有。
PilotDeck 这个项目,我今天早上认真看完之后,真正让我在意的,是它底层的理念。因为它好像解决了我之前用 Agent 时一直很不爽的一个点。
用过 OpenClaw 的人都知道,OpenClaw 的记忆是累积到 Agent 这一层的。

比如我今天告诉它,我们产品的核心用户是谁,主色调是什么,让它写进 Memory.md。这样 OpenClaw 就能长久记住我的偏好。
听上去挺好。但你想一个情况,如果我手上同时有好几个产品呢。记忆全堆在 Agent 这一层,就开始打架了。这条主色调到底属于哪个产品,它很容易就搞混。
你可能会说,那我把每个产品的信息分门别类写清楚不就行了。可这样另一个问题又来了,Memory.md 会越写越大,最后变成一个臃肿的大文件。
后来我用 Codex,发现它走到了另一个极端。
Codex 干脆没有长期记忆这个概念,所有记忆都留在 Session 这一层。这一轮对话结束,东西也就散了。
你换一个 Session,它什么都不记得,上下文得从头再说一遍。这同样很不方便。
前两天我还看到 Codex 的产品负责人分享自己用 Codex 的经验,说要把一些重要的会话长期置顶,这样每次过来就不用反复交代上下文了。
你看,连官方的人都得想这种办法绕一下。
说实话,看到这个经验分享,我反而觉得这个设计也许本身就有问题。
一种是 Session 级的记忆,一种是 Agent 级的记忆。我当时就在想,真正合理的颗粒度,会不会是夹在这两者中间的那一层,也就是以项目为单位。
因为真实工作里,真正长期存在的,其实不是某一次对话,也不是某一个 Agent,而是项目本身。
这就是 PilotDeck 这个开源项目的设计理念。
仔细想想,这个理念特别适合企业的生产力场景。
原因不复杂。我们在企业里用 Agent,做的事情基本都是一个一个具体的项目。每个人手头 focus 的,也都是某一个项目,或者说某一个 Workspace。
没人会闲着没事找 Agent 聊天扯有的没的,用到它的时候基本都是工作场景。而工作场景,差不多就是以项目为单位展开的。
既然事情是以项目为单位做的,那记忆和技能,按项目来归属也就最顺理成章。
PilotDeck 的思路正是这样,把记忆、技能这些信息全部归到具体的某一个项目里,项目和项目之间完全隔离。
这样一来,一个项目内部可以跨会话传递技能和记忆,换个 Session 也不会丢。项目和项目之间又互不干扰。
我猜有人可能会问,Codex 左侧那一列不也是按文件夹来组织的吗?是的,但那个文件夹只是在组织文件而已。
而 PilotDeck 是真的把项目当成了最小单元来运转。
这样做的好处是,我们可以把同一类任务都放进一个项目里,它们天然共享上下文,也共享技能。而不同的项目之间,从记忆到技能,都做了彻底的隔离。
比如下图是我一个奇思妙想的项目,它的记忆是完全独立的。Skill 也是。

还有一个好处,项目级的记忆也更省 Token。
很多时候,真正费 Token 的,未必是任务本身。而是 Agent 得先搞清楚,现在到底在做哪个项目。
因为历史信息一旦越来越多,它就得先从一大堆上下文里判断,哪些跟当前任务有关,哪些其实没关系。
这时候,上下文很容易越来越长。
项目级就不一样了。为这个 Workspace 里的东西,本来就只属于这个项目。
用过 OpenClaw 的朋友应该有体感。我们经常会遇到记忆或者上下文被污染的情况,那时候没别的办法,只能新开一个窗口重来。
但在 PilotDeck 这种结构里,这个问题基本就不存在了。所有的记忆、上下文还有文件,本来就都待在这个项目当中。
说白了,一个项目,就是一个完整的 Agent 工作环境。
#02
跑一个真实的 Case 看看
每次写完一篇文章,往往还得再查一遍错别字,看看哪些地方逻辑不顺,哪句话表达得不够清楚。
我现在的做法,是把整段文字扔给 Codex 或者 ChatGPT,让它帮我分析一遍,然后我对着它的反馈去改。
这个流程其实挺别扭。ChatGPT 给回来的是一大段文字,第一处怎样、第二处怎样。
我得拿着它说的关键词,回到原文里一处处搜,找到了再确认要不要改。文字和原文是分开的,来回对照特别费神。
我觉得更好的样子,应该像下面这张图。这张图是我用 GPT Image 2 生成的效果图。修改建议直接标在原文上,哪里有问题一眼就看到,而且可以一键采纳。

今天就用 PilotDeck 这个开源项目,把这张图的效果真正做出来。
顺便也跟大家分享一下我现在的工作流。我 Vibe Coding 做一个产品的时候,不会一上来就用自然语言把需求讲给 AI,让它实现。
我会先去 ChatGPT 里把效果图生成出来,然后再让 AI 写代码。这样做,能省掉非常多来回修改的时间。
道理也简单。需求用文字描述,AI 理解的和我心里想的,中间总有偏差。而效果图会更直接。
咱们开始干。
先在 PilotDeck 里创建一个项目。
项目有两种类型。第一种简单,在服务器上新建一个工作区,本质上就是一个文件夹,点确认就建好了。第二种是把工作区跟 GitHub 绑定,从一个 GitHub 仓库克隆下来。

Workspace 创建好之后,我们就和使用其他的 Agent 一模一样,说自己需求就可以。
这部分我就不过多赘述,因为所有的 Agent 都是这样,理解需求之后拆分任务,然后开始写代码。

就这样,看到效果之后,再不断地和 Agent 交互,表达我的需求。

面对一些模棱两可的需求,PilotDeck 也会出现下面这样的问询窗口,来和我们明确下一步到底要怎么干、优先满足哪一部分诉求。

下面这是最终的效果。我还是特别特别满意。大家看,我直接复制进来一段自己写的文章。左上角它会显示这一共有多少字。
紧接着我点审阅,右侧就会很快出现审阅的结果。如果我觉得 AI 说的没问题,直接点采纳按钮就行。
点模型设置按钮,可以看到能够配置模型的 URL、 API Key 以及提示词。
咱们再进去详细看看刚才提到的项目级记忆。
点开记忆之后,能看到这个项目的全部记忆,其实就是一个 Markdown 文件。
它还有一个记忆追踪的功能,我觉得挺好用,尤其是排查模型推理链路的时候。
比如我选中之前的一条指令,让它做一次 recall,它会把这次请求注入的上下文都列出来,对应调用了哪些工具,还有整个推理过程,都能看到。
这样一来,模型每次交互的 Context 对我们来说就是白盒的,里面发生了什么,一目了然。
当然,也因为它有项目层面的记忆和 Context。所以,我可以随便新开会话:

点右上角那排菜单的时候,我还看到了路由这个功能,截了张图,大家可以看一下。

它做的其实是 Token 路由,说白了就是不同的任务交给不同的模型去处理。
你看我这个项目,一共花了 12.5M 的 Token,右边还会告诉我省了多少成本。这部分路由逻辑,在左下角的设置里可以自己配置。
这个设计我觉得挺有意思。像 Codex 那类产品,模型选择是丢在右下角让我们自己挑的。
PilotDeck 是直接从产品层面把这件事接管了,我们可以配置自己的路由逻辑。
#03
写在最后
现在很多 Agent 项目,大家看起来都越来越像了。功能层面真的其实差距没有想象中那么大。
真正开始拉开差距的,慢慢变成了底层怎么组织 Agent。PilotDeck 最让我觉得有意思的地方,主要有两个。
第一个,是它把整个 Agent 的组织方式,建立在 Workspace 之上。这个点我觉得非常重要。
因为真实世界里的生产力,本来就是围绕项目运转的。项目有自己的上下文、记忆、流程、文风、协作方式,也会长期积累自己的经验。
第二个,是它对路由策略的理解。现在大家用 Agent,一个越来越现实的问题就是 Token 消耗。任务越来越复杂之后,成本很容易失控。
PilotDeck 的思路,其实有点像给不同任务自动分配不同级别的数字员工。复杂任务调用更强的模型。简单任务交给成本更低的模型。
尤其企业场景里,这件事我觉得会越来越重要。
所以看完之后,我最大的感受其实是,PilotDeck 这个项目,真正有价值的地方,可能不只是做了一个 Agent。
而是它第一次让我感觉,有人开始认真把 Workspace 本身,当成 AI 时代最核心的组织单元去设计了。
这个方向,我觉得未来可能会越来越重要。
最后再聊一下面壁智能这家公司。
可能很多人对它还不太熟悉,因为它一直做的是端侧的小尺寸模型。它在小尺寸模型领域的突破,我觉得完全不亚于 DeepSeek。
现在大家的焦点都在各种各样的旗舰大模型上。但我自己已经有明显的体感了,行业里很多场景,真正需要的其实是极致高效的小尺寸模型。
最典型的就是端侧设备。这类场景对延迟和隐私特别敏感,小尺寸模型几乎是必选项。
AI 越往真实场景里落,小尺寸模型这件事就越绕不开。这也是为什么大家一直在等苹果的杀手锏。
苹果手里最大的牌,就是能在端侧稳稳跑起一个小尺寸模型。
说回面壁。感觉这家公司在技术研究上有自己的定力,认准的方向会一直做。
但又不死板,行业怎么变它都能很快接得住,还总能拿出一点让人惊喜新成果,像今天的 PilotDeck 就很有意思。
这种坚定又灵活的状态,放在 AI 这个一天一个样的行业里,挺难得的。







