过去几年,我们对大模型有一个非常稳定的想象。
输入进去一段文字、图片或代码,模型内部跑完一整套 Transformer,最后经过 LM Head,输出 token;token 组成语言,语言再被人或软件理解,变成下一步行动。
它像一条固定流水线:Input→Transformer→LM Head→Tokens
这条路径如此成功,以至于我们几乎把它当成了“大模型”本身。
但8月、9月正在出现一批表面上没什么关系的实验:Decision Model、Early Exit、Hidden-State Readout、Latent Reasoning、VLA、结构化输出、推理运行时。
把它们放在一起看,会发现它们其实在拆同一条流水线。
有的在改模型从哪里输出;有的在改模型究竟跑多深;有的干脆在问,模型为什么一定要在 token 空间里思考。
于是,一个更大的问题浮出来了:
一个 Foundation Model,到底应该计算到哪里,又该以什么形式离开模型?
这不是“LM Head 后面还能接几个 Head”的问题。
它更像三次同时发生的解耦:
Capability ≠ Language Output 能力 ≠ 语言输出
Model Size ≠ Inference Compute 模型大小 ≠ 推理计算
Reasoning ≠ Token Generation 推理 ≠ 生成tokenJev 只是这轮变化里最早被很多人看见的一小段。
一、能力不再必须从语言里出来
以前,模型理解了一件事,往往要先把理解翻译成自然语言。
比如系统想知道一封邮件该归到哪个部门,传统路径通常是:
邮件内容→LLM 生成一句话→“这封邮件应由 Billing Team 处理”→软件再解析 Billing Team→路由这条路有点绕。
如果系统本来就只有三个候选项:billing、support、sales
为什么一定要让模型先在十万级词表里生成一个字符串,再让软件把那个字符串翻译回一个离散选择?
Decision Model 的出现,最初就源于这个问题。
它把任务改写为:
state + question + options
↓
probability distribution
↓
billing 0.82
support 0.13
sales 0.05Jev、Laya、Von、GLiNER、Julia、Strands、Clef,看上去是不同项目,但都在尝试让模型跳过“先说一句话”的步骤。
有的选择 encoder。
Laya、Von、Julia 这类模型会把状态、问题和候选项一起输入,让每个 option 成为输入里的一个位置;一次 bidirectional forward 后,直接对不同候选项打分。
BERT 类模型就这样突然复活了
过去几年,decoder-only LLM 几乎吞掉了所有注意力,但 Agent、自动化系统、风控链路、审核系统真正运行起来后,反而产生了很多不需要生成的工作:
- 该用哪个工具;
- 这是否违反规则;
- 这份证据是否足够;
- 是否需要升级给人;
- 当前状态有没有变化;
- 哪条路径风险最低。
对于这些工作,模型的最终产物不是一段文字,而是一个选择、一个分数、一组排序,或一个带置信度的“是/否”。
于是问题变成:
当输出空间本来就很小,为什么还要默认使用语言生成架构?
BERT 复活战胜 LLM
LLM 把 AI 软件做大之后,制造出了大量不值得调用 LLM 语言出口的计算。
二、LM Head 是一个很特殊的出口
这个变化再往前走一步,会触及一个更根本的问题。
LM Head 的功能,是把模型内部状态投影到一个巨大词表上:
hidden representation 隐藏表示
↓
vocabulary distribution 词汇分布
↓
next token 下一个令牌非常适合语言,但语言只是众多输出空间中的一种。
如果任务是分类,输出空间可能是:K 个离散选项
如果任务是排序,输出空间可能是:一个候选集合上的分数与排列
如果任务是风险控制,输出空间可能是:概率 + 风险边界
如果任务是机器人控制,输出空间可能是:R^7 的连续动作
如果任务是轨迹规划,输出空间可能是:R^(T×D) 的动作序列
这可以叫作:Output Geometry,输出几何。
它决定了模型最终需要在哪种空间里表达自己的判断。
语言只是其中一种极为通用、也极为成功的输出几何。
但“最通用”,不等于“每个任务都最合适”。
这也是 Clef 这类模型真正值得注意的地方。它不只是让模型回答一个 choice,而是把:
state+ typed questions+ allowed options+ multiple fields状态 + 输入问题 + 允许选项 + 多个字段
一起交给模型,再让 joint schema head 联合读取不同字段之间的关系。
这更接近:给模型一个动态定义的任务空间,让它把内部表征直接映射到这个空间中。
Schema 开始承担另一种工作:它告诉模型可以输出什么、候选集合是什么、字段如何关联、什么叫作合格的结果。
过去我们习惯说:Prompt defines the task. Prompt 定义任务
接下来:Schema defines the task space. Schema 定义了任务空间。
这在机器人领域更明显。
VLA 不会满足于让模型生成一句“向左移动手臂”。它需要模型直接进入可执行的动作空间:连续控制、轨迹、姿态、速度、可达范围、环境约束。
Reasoning-VLA 使用 action queries 从视觉—语言表征中直接读取轨迹;InternVLA-A1.5 则在 VLM backbone 后接统一的 action expert;尝试让表征直接变成动作。
语言模型现在才开始遇到的问题,机器人模型其实已经提前在经历:
什么样的输出几何,最适合这个任务?
是 action token?连续回归?Diffusion Action Head?Flow Matching?离散扩散?
答案不会只有一个。
三、模型有多深,不等于每次都必须跑到底
如果说换 Head 是在改“从哪里出来”,那么 Early Exit 和 Adaptive Depth 改的是另一件事:模型究竟要跑到第几层,才算完成这次计算?
过去,一个 32 层模型,通常意味着每个请求都跑 32 层。
未来可能不是。
AnyJev 很值得注意,它提出了一种激进做法:在多个中间层上尝试读出结果,找到对于某类任务最有效的 readout depth。
未来的路径,不一定需要继续跑到第 32 层,再经过 LM Head 输出一个 “A”。
这件事改变了 Linear Probe 线性探头的身份。
过去,Probe 是显微镜。
研究者把 probe 插进第 12 层、第 20 层,问的是:
- 这一层知道词性了吗?
- 这一层知道真假了吗?
- 这一层已经包含答案了吗?
现在,AnyJev、PING、流式安全判断等方向开始问:
如果 probe 真的读得出来,为什么不直接把它作为产品输出?
于是,Probe 从解释模型的工具,开始变成使用模型的接口。
过去是:Fine-tune a model
后来是:Train a LoRA
现在又多了一个极小的定制单位:Fit a readout
一个几十 GB 的 Foundation Model,可能共享给多个任务;每个任务只需要一个 KB 到 MB 级别的 readout:
One Backbone
├── fraud readout
├── routing readout
├── moderation readout
├── policy readout
├── quality readout
└── safety readout这对企业定制 AI 的经济学很有诱惑力。
不一定需要六个微调模型,只需要一个基础模型,再加六个不同的读出方式。
但这里必须踩一脚刹车。
四、信息已经在那里,不等于模型已经算完了
看到中间层可以读出答案,很容易得出一个漂亮结论:
模型早就知道答案,后面的层都是浪费。
目前证据并不支持这么简单的说法。
有一个非常重要的区分:
information exists≠information is accessible≠computation is complete信息存在≠信息可访问≠计算完成
中间层可能包含很多丰富信息,但这些信息不一定已经位于一个容易被最终任务读取的方向上。
所谓“模型知道”,可能只是内部某些表征包含了相关线索;而要把这些线索整合为稳定、可迁移、对当前任务有效的结果,仍然需要后续计算。
一篇研究把它概括为 representational capacity 与 accessibility 的区别:模型内部可能有能力容纳这些信息,但它并不等于这些信息已经可以被当前输出机制稳定访问。
Probe 自身也可能骗人。
一些 probe 在特定 benchmark 上看起来非常准确,但后来发现,它读到的可能是选项数量、回答长度、任务格式等旁路信号,而不是所谓“演绎推理能力”。
所以,Readout Revolution 不能建立在“中间层藏着一切真相”的浪漫想象上。
真正严肃的问题应该是:
哪些任务的答案已经足够稳定地存在于中间表征中?
哪些任务仍需要更深的计算,才能让信息变成可用判断?
这正是未来模型研究最难、也最值得做的地方。

五、Depth Scaling:参数量之外,出现了“这次究竟跑了多深”
过去讨论推理扩展,大概有几种办法:更大的模型、更多 token、更多 test-time compute
现在可能需要加上第四种:同一个模型,不同的计算深度
FlexiDepth、Mixture-of-Depths、Dr.LLM 等方向都在尝试让不同 token、不同任务、不同不确定性水平获得不同深度的计算。
未来一个模型的描述,可能不再只是:这是一个 8B 模型。
而会变成:
routing:12 / 32 layers
moderation:18 / 32 layers
semantic decision:24 / 32 layers
complex reasoning:32 / 32 layers这对应一个很有吸引力的抽象:
Compute-to-Confidence 计算到置信度。
不是预先规定“每次都给模型 32 层”。
而是让系统尽量算到足够确定为止。
但它也带来一个极其反直觉的现实:少算,不等于更快。
从模型数学上看,32 层只跑 20 层,显然应该节省大量 FLOP。
可进入真实 serving 系统之后,事情不再这么简单。
现代推理引擎围绕固定深度、连续 batch、固定形状张量、Paged KV Cache、CUDA Graph Capture 做了大量优化。动态改变不同请求跑哪些层,恰好会打碎这些假设。
vSkipper 的研究就指出,一些理论上能节省层数的方案,直接塞回普通 generation loop 后,实际延迟反而可能比 baseline 更差。只有当运行时本身开始支持 routed execution、计算虚拟化和可变路径调度,理论上的 FLOP 节省才可能转化为真实的 serving gain。
这意味着,Adaptive Depth 不是一个部署层的小技巧。
它最终会迫使模型架构和推理运行时重新共同设计。
六、连“思考”本身都未必需要经过 token
换输出 Head,解决的是模型最终不一定要说话。
提前退出,解决的是模型不一定要跑完整条深度。
但 Coconut、Soft Latent Thinking 等方向提出的问题更深:
模型内部的推理,为什么一定要通过 token 一步步进行?
我们熟悉的 LLM 推理循环大致是:
hidden state→LM Head→token→embedding lookup→next hidden state模型每一步都要先选出一个离散 token,再把它重新嵌入为下一步的输入。
这非常适合语言。但它也意味着,每一步内部思考都要经过一个巨大的词表投影、离散选择和重新编码过程。
Coconut 的思路很直接:把一个 hidden state 直接作为下一步输入,而不强迫它先变成一个词。Soft Latent Thinking 则尝试在 reasoning 阶段绕开 vocabulary head,在连续 embedding space 中进行 rollout,最后再回到语言输出。
这里必须区分两件事。
第一种是:Output without language 无语言输出
模型内部仍然按常规运行,只是最后输出 probability、reward、action 或 schema。
第二种是:Thinking without language 不依赖语言的思考
模型在中间计算阶段,也不再每一步都把状态压缩为 token。
后者远比前者激进,它暗示未来模型未必是“用语言思考,再用语言回答”的系统。
它可能只是“能够通过语言与人交流”的系统,而内部计算可以走完全不同的路径。
现在还很早,很多结果仍局限在特定任务和模型规模上。
但问题已经被提出了。
七、把这些放在一起,模型开始出现一张新的设计地图
仍用“Decision Model Landscape”来理解这些变化,会不够细致。
更好的方式,是把它们放进四个维度。
维度 | 核心问题 | 代表方向 |
|---|---|---|
Depth | 算到哪里停止? | AnyJev、FlexiDepth、Dr.LLM |
Thought Space | 在哪里继续计算? | Token、latent、recurrence |
Readout | 怎么读取内部状态? | LM、pointer、probe、schema、action |
Contract | 软件如何理解输出? | token、概率、风险、动作、conformance |
这样看,一些看似无关的项目就突然清楚了。
- Strands 主要在改 Readout;
- AnyJev 同时在改 Depth 与 Readout;
- Coconut、Soft Latent Thinking 在改 Thought Space;
- Clef 在改 Readout 与 Schema;
- VLA 在改 Output Geometry;
- vSkipper 在处理 Depth 与 Runtime 的矛盾;
- NoulXP 则在改 Contract。
它们都在尝试让一次 inference 不再由模型架构提前写死。
这就是可编程推理路径,Programmable Inference Path。
八、模型开始从 checkpoint,变成一份可执行合同
过去,一个模型文件大概意味着:weights + config + tokenizer
这套定义适用于语言生成,因为生成模型的输出本来就比较宽松。
“Paris”和“The answer is Paris”,很多时候都算对。
采样略有不同,也通常不影响系统接受结果。
但当模型直接进入软件 control flow,情况变了。
0.49 和 0.51可能不是语气差异。
它们可能决定:
deny 还是 execute这时,模型不能只是一堆权重。
它需要携带更多语义:
weights + input template + readout location + output schema + calibration + conformance cases权重 + 输入模板 + 读出位置 + 输出方案 + 校准 + 合规测试用例
NoulXP 之类的尝试已经在朝这个方向前进:模型包不仅要包含权重,还要描述如何构造输入、如何运行 readout、如何校准,以及另一个 Runtime 怎样确认自己复现了相同的决策。
这很像一个信号,模型正在从 checkpoint 检查点,变成 executable contract 可执行合同。
它不只是“跑起来”,还要回答:
- 这个输出是什么意思?
- 这个概率是否可比较?
- 这个 Runtime 是否复现了同样的结果?
- 这个模型是否在承诺的风险范围内工作?
未来模型输出甚至可能不仅是:A = 0.82
还会附带:
estimated probability = 0.82
risk bound < 0.05
coverage = ...这时模型交付给软件的,不只是 semantic output 语义输出。
而是一份 statistical contract 统计合同。
九、这条路没有那么顺,四个问题都很硬
这一轮变化很大,但远没有到“模型从此随便早退、随便换头”的阶段。
第一个问题是 representation stability 表示稳定性
换一次 backbone 版本,旧 readout 是否还能有效?换一次训练数据、模型架构、tokenizer 或对齐策略,原来读出的方向是否全部漂移?
很可能不会天然稳定。
第二个问题是 distribution shift 分配切换
一个在训练和校准分布上置信度很准的模型,进入陌生行业、陌生 schema、陌生选项组合后,可能迅速失准。
第三个问题是 serving complexity 服务复杂性
Variable-depth、multiple adapters、different heads、latent recurrence 混在一起后,continuous batching、KV cache、GPU 调度和 tail latency 会变得极其复杂。
第四个问题是 deliberation 慎重考虑
一个任务的最终输出可能只是“Yes”。
但这不意味着它只需要一层线性读出。
短输出,不等于浅认知。
Short output ≠ Shallow cognition 短输出 ≠ 浅层认知这是未来所有 Decision Model、Early Exit 和 Probe 产品都必须记住的一句话。
不能因为结果是一个选择,就假定模型不需要真正思考。
十、Language Model 可能只是 Foundation Model 的一种接口
过去,“Foundation Model”大致意味着一个巨大的通用预训练网络,可以被微调到不同任务。
现在,这个词或许会变得更字面一些:
Foundation,指的是共享的表示能力与可复用的计算底座。
在这块底座上,可以接:
language decoding 语言解码
structured generation 结构化生成
decision pointer 决策指针
classification probe 分类探针
reward / value 奖励/价值
safety monitor 安全监控
action policy 动作策略
latent recurrence 潜在循环于是,Language Model 仍然会非常重要。
语言依然是人与模型交流最自然、最开放、最兼容未知任务的界面。
但它不必再是模型与软件、模型与机器人、模型与风险系统之间唯一的中间层。
这可能才是 Jev 这轮实验真正共同指向的变化。
大模型正在失去的,是一个过去几乎没人质疑的默认设定:
每一次推理,都必须跑完整个模型,并通过语言 token 离开模型。
未来的模型,会由系统决定:
跑哪个 backbone → 跑多少层 → 是否进入 latent reasoning → 挂哪个 adapter
→ 从哪一层读取 → 用什么 readout → 以什么 contract 返回那时,“一个 70B 模型”这句话,可能已经不足以描述一次真正发生的 inference。
因为最重要的问题不再只是模型有多大。
而是:它这一次,究竟走了哪一条路。
>/作者:王零壹,920.org.cn(AI Research Institute)创始人,港大AIBT研究生,前上市公司 CMO。长期研究 AI 产品、Agent 架构与商业增长,并持续观察技术变迁如何重塑人的工作、判断与生活。
*著有《AIGC从0到1》系列丛书、及东方寓言小说《飞将军》;
*善于洞察先机,中文互联网第1个意识到OpenClaw范式价值的人(1月26日);
关注我,一起AIGC从0到1~







