
如题,
这是一个最近伴随着模型迭代越来越频繁,以及我自己大量使用各种Agent之后的想法。
说这个想法前,得先让我讲讲我对AI上半场的定义。
其实很简单,在我看来,上半场无非就是卷模型参数,卷模型性能。大家比的就是哪个模型能在Benchmark上刷出高分。
从远古时期的GSM8K 再到后面的SWE-Bench Verified ,谁能拿到高分谁就能称王称霸,逻辑非常简单。
而且那个时候每个月对应的账单也很简单。换句话说,使用AI带来的账单消耗是相对可控的。
但是后来大家开始讲深度思考,O1、R1就是基于此研发出来的模型代表。它们最明显的特征是不管什么问题,先思考一大堆时间。从此,成本就开始上升。
到后来Claude Code 点起了一把火,大家开始讲Agent 了, 这便是下半场的开始,也由此引发了一系列的变化。
01Token 消耗持续增长
一个最明显的变化,Token 消耗在指数级地增长。
以前我们的流程是,一个问题问下去,AI回答完就结束了。
但是Agent 不一样,Agent 是边想,边回答,还得帮你执行,执行完了之后还得验证,要是发现有问题的话,还得再修复。
这样一个任务下来,消耗token 起码是以前的5-6倍(我瞎猜的,我没仔细算过这里哈哈,总之就是很多倍)。
Token 消耗增长带来的第一个连锁反应就是账单爆炸 。
以前我们会觉得OpenAI推出一个月200刀套餐是想钱想疯了,现在会觉得这大概是这世上最值钱的AI订阅服务。
但即使是OpenAI、Anthropic 这样的头部厂商,很明显也已经吃不住让你一直使用最贵的模型。
所以我们会看到无论是OpenAI,还是Anthropic也好,都非常推荐的一种做法是,
要把一个任务拆给多个模型来完成。比如强力模型负责规划,弱一点的模型负责根据规划执行。
这样做最明显的一个好处是会省token。
Token 消耗增长带来的第二个连锁反应是缺算力。
Anthropic 在买马斯克的算力之前,经常服务宕机;OpenAI 也已经扛不住了,取消了Pro的订阅了;无敌不缺钱的Grok,最近也一直重试;
海外都这样,国内就更加不用多说了。大家连训练都缺卡,就更别说用于推理服务了,报错429过载,已经是常态。
除了Token消耗的增长之外,还有一个很明显的变化是训练任务的升级。
02训练任务升级
毫无疑问,模型的训练数据到现在也在不断的升级。
从最简单的一问一答,再到思维链的训练,然后是基于coding的一套可验证执行的训练方式,再到现在复杂的Agentic式的训练。
这个Agentic式的训练,不止包括模型在一个环境里调用工具,完成多步、长时的任务,也同时包含了Agent 执行任务时,会留下工具调用、环境反馈和错误修复等完整过程,而这一个完整的过程就是模型最好的后训练内容。
之前看X上专门介绍Paper的大佬,AK,介绍过一篇论文,非常有意思。

讲的是来自基元律动这个团队训的NeoHorse-1 这个模型。
这个模型基于Qwen 3.5做了后训练,有4B 和9B 两个版本。 它值得关注的点是它的后训练方式。
他们先把Agent 干活的整个轨迹都一一记录下来,包括Agent 是如何调用工具,遇到报错是如何处理的,以及最后有没有把这件事情做成。
团队把这些东西整理、筛选成模型可以学习的内容。听上去就跟人类积累沉淀过往的经验一样。
然后再借由OpenSquilla这个自家的路由harness,对任务所需要的能力进行判断,给这些教材排一个学习顺序。
让小模型从简单的任务开始学习,逐步学习更复杂的任务,最后尝试自己生成,由教师模型针对它实际生成的内容进行指导。
这套后训练流程想做的其实就是一件事儿:
它想把Agent执行任务时积累的有效经验,变成可训练进模型的自身能力。然后让新的模型重新进入任务执行,再从新的表现里发现短板,再反过来调整下一轮训练。
所以,这也是为什么我在标题就说,
AI的下半场,当AI开始积累过往经验。
03迭代飞轮
由此,我们不难推断出,
随着Agent的token消耗量越来越大,产生的轨迹数据越来越多,那自然也会越来越提升模型的训练迭代速度和质量。
事实也确实如此。
基元律动基于Qwen 3.5 训练的4B和9B 模型,NeoHorse-1跑通了这一个过程。其中4B模型在十项测试的平均分上提升了5.93分,9B模型提升了3.44分。


还有一组实验可能更有意思:
同样从 Qwen3.5-4B 出发,使用相同的路由引导训练配置、接近的训练预算,一组用 Harness 产生的执行轨迹,一组用公开的 Toucan 合成工具数据。
前者在五项可比测试上的平均分,高了 6.26 分。
这至少说明,经过处理的Agent工作轨迹,确实可以成为有价值的训练数据。
所以,我们可以在把这个飞轮放到商业环境上来看。
对于基元律动来说,
OpenSquilla 本身是他们开源 的Harness,能够根据任务的不同,来选择不同的模型、工具完成任务。
而TokenRhythmAPI 承接的是模型调用和服务。
使用这两个东西,所产生的有效反馈,就进入训练,产生新的NeoHorse模型。
更新后的小模型能承担更多的工作,就可以减少昂贵模型的使用成本。
成本下降以后,同样一份预算,就可以支撑更多任务。更多任务又有机会带来更丰富的执行经验,为下一轮训练提供数据。
开源带来使用,使用产生反馈,反馈改进模型,模型改善服务,服务再承接更多使用。
所以,开源、做 API服务、训练模型,三件事儿也可以被认为是一件事儿,它可以做成一个持续运转的商业飞轮。
组织层的重要性,也体现在这里。
它处在任务、模型和执行结果之间。既要决定如何让Agent把任务做好,也要帮助Agent找到下一轮训练改进的方向。
而基元律动用4B 和 9B 的小模型已经验证了这一点儿。
04最后写点
所以,到底什么是Agent?
这个问题从Agent 还没爆火的时候,我就一直在思考。
如果以前你问我,
我会觉得是
Agent=LLM+Tools+Memory
这是一个非常标准的公式。
但是随着时间的推进,看到越来越多的东西之后,我觉得这个定义还是太复杂了。简单点来说,
Agent= Models + Routing Harness
未来大家使用模型肯定不会只使用一家,比如写代码,写一个新功能是用一个模型,写完之后的review 又是另一个模型。
所以如何组织编排模型这件事儿变的越发重要,不仅是省成本,也是为了把模型的价值发挥到最大。
还有模型本身,
一个Agent Native 的模型,它是基于Base 模型后训练而来的。
而这个后训练模型,得益于它的Harness 不停地产生了大量的可复用的轨迹数据,能够让它在一次次训练中加速变得更好。
当这个飞轮转起来的时候,就会发现这个世界真得变化得太快了。
当AI不停的加速迭代自己的时候,
有的时候真的很难理解在发生什么。
只能说,
我爱这个充满魔幻的AI世界。







