过去一年,AI Agent 的能力进化非常快。
从写代码、查资料、做 PPT,到跑脚本、接飞书,Agent 正在从聊天助手,变成能够调工具、记上下文、跨步骤完成任务的“数字员工”。
然而,能力越强,成本焦虑也越明显。尤其是最近 Fable 5 等顶级模型发布后,不少开发者发现,一旦把 Agent 跑起来,Token 消耗速度远超预期。
复杂任务往往需要反复规划、检索、调用工具、读写文件、调试代码和总结输出,每一步都在大量占用上下文。并且很多 Agent 框架会默认把所有请求都扔给最贵、最强的模型处理,哪怕是简单查询也不例外,导致预算迅速失控。
今天要给大家介绍的开源 Agent Harness 项目 OpenSquilla,正是瞄准这个问题。
OpenSquilla 背后的开发团队是基元律动,由原华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创立。
作为长期深耕大模型与 AI 系统架构的一线技术负责人,王云鹤曾带队推进华为盘古大模型相关研发,也因此更清楚大模型从能力展示走向真实生产场景时,绕不开成本、效率、上下文管理和安全执行等系统性问题。
所以,OpenSquilla 并不是简单再做一个 Agent 聊天界面,而是更像一次面向 Agent 基础设施的重构。
它是一个面向 CLI、Web UI 和聊天渠道的微内核 AI Agent,核心能力包括智能路由、持久记忆、安全沙箱、内置搜索和本地嵌入等。
OpenSquilla 提出了“Token-Efficient AI Agent”的思路,试图在同样预算下,让 Agent 做更多事、做得更好。
目前,该项目在 GitHub 上已收获 5.5k Stars。


- 项目链接:
https://github.com/opensquilla/opensquilla
01
OpenSquilla真正开源的
是一套 Agent 运行时
OpenSquilla 的底层设计,可以理解为“微内核 + 路由器 + 记忆系统 + 沙箱 + 技能层”。
所谓微内核,就是把 Agent 的核心决策循环做得足够统一、足够稳定。无论用户从 Web UI 进入,还是从命令行进入,或者从飞书、钉钉、企业微信等渠道进入,最终都会进入同一个 TurnRunner 执行循环。
这样一来,工具调用、重试逻辑、日志记录、成本统计和安全策略不会因为入口不同而割裂。
这点很重要。
很多 Agent 项目在早期会先做一个界面,再不断往上堆功能。结果是 CLI 一套路由、Web UI 一套路由、聊天机器人又一套路由。功能看似很多,但长期维护很困难。
OpenSquilla 的做法更接近“Agent 操作系统”的思路:先把运行时抽象出来,再让不同入口接入同一套内核。
OpenSquilla 最核心的亮点,是它的 Token-efficient routing,也就是省 Token 的智能路由机制。
项目内置的 SquillaRouter 使用 LightGBM + ONNX 本地分类器,会根据每轮请求的长度、语言、代码块、关键词和语义嵌入等特征,判断这个任务应该分配到哪个模型层级。
简单任务走低成本模型,复杂任务才启用更强模型。整个分类过程在本地完成,提示词不会为了做路由而额外发到云端。
这背后其实对应了 Agent 时代的一个新趋势:模型不再是单点选择题,而是系统调度题。
以前开发者常常纠结“我到底该用哪个大模型”。但在 Agent 场景里,更合理的做法是:不同任务、不同步骤、不同风险等级,用不同模型。写一段简单说明不需要最强模型;多文件代码重构、长链路推理、复杂论文写作才需要强模型接管。
OpenSquilla 把这个调度能力做成本地路由器,让 Agent 能够在“能力”和“成本”之间自动做选择。
在常规场景内测中,OpenSquilla 可以达到平均 60%-80% 的 Token 成本节省效果。


官网链接:
https://www.opensquilla.ai/zh/news/0.5.0-preview-2/
除了路由,OpenSquilla 的第二个关键能力是持久记忆。
很多 Agent 的问题不是不会回答,而是“记不住”。OpenSquilla 使用本地持久记忆机制,把 MEMORY.md、日期化 Markdown 笔记、SQLite 全文检索和 sqlite-vec 语义召回结合起来。嵌入可以通过本地 ONNX 运行,也可以替换为 OpenAI 或 Ollama 等方案。
这使得 OpenSquilla 不只是“临时对话框”,而更像一个能长期积累上下文的 Agent 工作台。
第三个重要能力是安全沙箱。
Agent 一旦能读写文件、执行命令、调用工具,安全问题就会被放大。OpenSquilla 提供三档安全策略:Standard、Strict 和 Locked。
Linux 下可用 Bubblewrap 隔离代码执行,macOS 下通过 Seatbelt 执行沙箱控制,Windows 则使用原生后端。
它还会记录拒绝执行的操作,并在多次拒绝后自动暂停自主运行,同时对技能元数据和工具结果进行 XML 转义,以降低提示注入风险。
这对于企业和开发者来说非常关键。
因为 Agent 真正进入工作流以后,不只是“回答错了”这么简单,它可能会误删文件、误执行命令、误调用接口,甚至被外部文本里的恶意指令诱导。
OpenSquilla 把安全沙箱放在核心能力里,说明它关注的不是 Demo,而是更接近生产环境的 Agent 运行问题。
第四个能力,是 Skills 与 MCP。
OpenSquilla 内置了 15 个按需加载的技能,覆盖 coding、GitHub、cron、PPTX、DOCX、XLSX、PDF、总结、tmux、天气等任务;同时它既可以作为 MCP Client,也可以作为 MCP Server 运行。技能不会一股脑塞进上下文,而是在任务需要时加载,这有助于降低上下文噪声和 Token 浪费。
在这个基础上,OpenSquilla 还引入了 Meta-Skills。
如果说普通的 Skill 是完成某个具体动作的能力(比如“生成 PPT”“执行 Git 操作”“搜索资料”),那么 Meta-Skill 更像是一个可复用、可组合、可演化的多步骤工作流模板。
它把一系列 Skills 按照逻辑顺序组织起来,并加入判断、分支、循环和人工审核节点,形成一套结构化的“流程配方”。
举例来说,一个“论文写作 Meta-Skill”可能包含:文献检索 → 提纲生成 → 逐节撰写 → 引用格式化 → 全文润色 → 生成参考文献 等多个环节。用户只需给出主题,智能体就能按照这个流程自主推进,整个过程透明、可追溯、可反复优化。
这让 OpenSquilla 真正实现了从“会使用工具”到“会沉淀流程”的重要跨越。
OpenSquilla 内置了 meta-skill-creator 等能力,智能体在完成任务后,可以自动分析执行轨迹,提出新的 Meta-Skill 建议,供用户审核确认。
这意味着 Agent 不再是被动执行者,而是能够“自我成长”、不断积累组织级知识的工作伙伴。
在实际使用中,Meta-Skills 大幅提升了任务的标准化和可复制性。无论是短剧创作、项目立项、竞品分析,还是代码重构、报告生成,用户都可以把成功经验固化成 Meta-Skill,极大降低重复劳动,让团队知识真正沉淀下来。
最新版OpenSquilla,重点升级了路由与桌面/运行时体验,加入 Model Ensemble Routing 的预览能力。
开启ensemble模式后,系统会把更难的任务分发给多个候选模型,在知名的DRACO深度研究评测中超过了所有单模型基线。值得注意的是,居然超过了目前业界最强模型Fable 5。

总而言之,OpenSquilla 的方向已经不只是“便宜模型替代贵模型”,而是在探索一种更高级的 Agent 路由形态:让多个模型参与同一个复杂任务,再由系统完成调度、比较和选择。
02
使用教程
OpenSquilla 提供多种上手方式,包括桌面客户端、终端快速安装、源码安装和开发者源码模式。
macOS 和 Windows 用户可以直接安装桌面版本。
macOS Apple Silicon:
https://github.com/opensquilla/opensquilla/releases/download/v0.5.0rc2/OpenSquilla-0.5.0-rc2-mac-arm64.dmg
Windows x64:
https://github.com/opensquilla/opensquilla/releases/download/v0.5.0rc2/OpenSquilla-0.5.0-rc2-win-x64.exe
Linux 用户可以通过 uv 安装。
uv tool install --python 3.12 "opensquilla[recommended] @ https://github.com/opensquilla/opensquilla/releases/download/v0.5.0rc2/opensquilla-0.5.0rc2-py3-none-any.whl"03
不只是省 Token,OpenSquilla指向的
是Agent Harness的下一阶段
如果只把 OpenSquilla 理解成一个“省 Token 的 Agent”,其实还是低估了它。
它真正值得关注的地方在于:OpenSquilla 不是围绕某个模型做增强,而是在模型外面搭了一层更完整的 Agent Harness。
当 Agent 只是回答问题时,模型能力本身最重要;但当 Agent 真正进入写代码、查资料、生成文档、调用工具、连接企业系统的长链路任务后,决定体验的就不只是模型参数和 benchmark 分数了,而是模型之外的运行时工程。
OpenSquilla 的 Token-efficient routing,正是在回答这个问题。不是所有任务都值得调用最贵模型。简单任务可以交给低成本模型,复杂任务再交给强模型,甚至让多个模型共同参与难题处理。这样一来,Agent 不再是粗放地“烧 Token”,而是开始具备按任务复杂度分配算力的能力。
持久记忆则解决了另一个更长期的问题。Agent 不能每次都从零开始。只有把项目背景、历史任务、用户偏好和长期笔记沉淀下来,Agent 才有可能从一次性助手,变成真正可持续协作的工作伙伴。
安全沙箱的意义同样关键。Agent 一旦拥有读写文件、执行命令、调用外部工具的能力,它就不再只是聊天机器人,而是有行动能力的软件实体。OpenSquilla 把权限控制、沙箱执行、拒绝记录和提示注入防护放进核心能力里,说明它瞄准的不是 Demo 场景,而是更接近生产环境的 Agent 落地问题。
OpenSquilla 还在快速迭代之中,Model Ensemble Routing、Meta-Skills、多端入口和 MCP 生态也都还有继续完善的空间。但它已经给出了很清晰的信号:
Agent 的下一阶段,不只是让模型更强,而是让模型被更好地组织起来。
当越来越多模型、工具、知识库和企业系统接入 Agent,真正决定 Agent 能否落地的,可能不再是单个模型的能力上限,而是外面那层 Harness 能不能把这些能力稳定、安全、低成本地编排起来。
OpenSquilla 开源的,正是这样一套面向未来 Agent 工作流的运行底座。







