最近很火的 Jev 是一种直接输出结构化判断结果的 System One 模型。
有位哈佛的研究员开源了一个项目叫 RSI-Jev,让 AI Agent 自己提出 Jev 模型改进方案、跑实验、评估结果,再把更好的版本保留下来继续迭代。


目前,RSI-Jev 已从 v1.0 迭代到 v3.0,累计进行了 204 个实验 Arm。开发者也一直在 X 上同步模型的阶段性进展。

最新 v3.0 中,系统探索了 59 个强化学习训练分支,最终筛选出一套有效的 Listwise Reranking Reward,在记忆重排序任务中将 R@1 从 0.192 提升到 0.308。

01
重新搭建类Jev模型
和直接调用官方 Jev 不同,RSI-Jev 选择从头搭建一个开源的 Jev-style System One 模型。
第一版 v1.0 以 Qwen3.5-0.8B-Base 和 Qwen3.5-2B-Base 为底座,并额外加入一个 Cross-Attention Scorer。

模型读取 Document 和问题后,会把决策位置的隐藏状态作为 Query,把候选项表示作为 Key 和 Value,通过 Cross-Attention 直接计算每个候选项的 Logit。
因此,它不需要生成一段自然语言,而是直接输出不同候选项的概率。
早期实验中,开发者发现只训练顶部决策 Head 的效果有限,最终改为对整个模型进行 Fine-tune。随着底座从 0.8B 扩大到 2B,typed-decisions 得分也从约 0.61 提高到 0.66。
这些模型结构、数据和训练方法,也成为后续 RSI 系统继续探索的基础。
02
RSI-Jev怎么实现
递归式自我改进?
RSI-Jev 的 RSI,并不是让模型直接修改自己的权重,而是在模型外面搭建了一套自动化的 AI 研究流程。
负责驱动这套研究循环的系统,是开源项目 AutoScientists 的下一版本。因此,RSI-Jev 并不是临时拼出一套 Agent 工作流,它是在已有自动科研框架的基础上继续演进,让 AI 自动提出假设、执行实验、分析结果,再决定下一步研究方向。

项目把模型结构、训练数据和训练方法等代码标记为 EDITABLE,允许 Agent 修改;而评测代码、指标和测试数据则被设为 PROTECTED。
Agent 可以改模型,但不能改考试规则。
每轮实验开始后,Agent 会分析当前表现最好的 Champion,从模型结构、数据和训练方法等方向提出新的 Hypothesis,并提前登记预期提升。
随后 GPU Agent 负责真正训练和评测。
新方案需要按照预先设定的指标和 Guard Metric 接受评测,达到保留条件后,才有机会进入新的 Champion 路线。
项目第一轮就同时使用了 3 个 Analyst Agent、6 个 GPU Agent、1 个 Monitor 和 1 个 Orchestrator,测试了 24 个方向。
结果一个都没有达到要求。
这些失败实验同样会被记录下来,并用于调整下一轮的研究方向。
这也是 RSI-Jev 的核心,不是让 Agent 随机试参数,而是让上一轮实验结果持续影响下一轮研究。

03
从v1.0到v2.1,解决
“越训练越偏”的问题
进入后续 RSI 循环后,系统开始尝试把 Benchmark 的训练数据加入模型。
typed-decisions 很快从 0.662 提高到 0.7794,但代价是模型的通用知识能力下降。
于是 Agent 又加入 15% General-Knowledge Replay,一边学习 Decision 数据,一边保留通用知识,typed-decisions 进一步达到 0.796。
v2.0 还增加了一个 Confidence Head,专门校准模型输出概率,让模型给出的置信度更加可信。
但系统随后发现,这些提升主要集中在见过的 Benchmark 上,未见任务上的提升并不明显。
继续实验后,Agent 找到了新的折中方案:不冻结底层网络,而是让底部 8 层以正常学习率的 1/10 继续训练。
这样既能让底层适应新任务,又能减少原有知识被覆盖。
这一方案最终进入 v2.1。
04
59次RL实验,留下
一个有效Reward
到了 v3.0,RSI-Jev 开始重点探索强化学习。
系统先后测试了 11 类 RL Setup、59 个 Reward-trained Arms,但大部分方案都没有超过监督学习,甚至出现性能下降。
这些实验最终让项目得到一个关键判断,如果 Reward 提供的信息和监督学习标签完全一样,RL 很难带来额外收益。
于是系统开始寻找“普通 Label 无法直接表达”的训练目标,最终找到了 Listwise Reranking Reward。
比如 Agent 的长期记忆中有 16 条候选 Memory。普通监督学习可以分别判断每条 Memory 是否相关,但实际应用更关心的是这 16 条 Memory 放在一起,谁应该排第一?
因此,v3.0 不再只独立判断单个候选项,而是对整组候选结果进行排序,并按照 NDCG@5 给整套排序计算 Reward。
最终,这成为 59 个 RL Arm 中被正式保留下来的方案。
在 Memory Reranking 测试中,正确 Memory 排名第一的 R@1 从:
0.192 提升到 0.308。
相比 v3.0 的监督学习 Parent,提高约 60%,同时其他 Benchmark 整体基本保持稳定。
05
总结
从 v1.0 到 v3.0,RSI-Jev 已经进行了 204 个实验 Arm,其中绝大多数实验最终都没有进入正式版本。
但这恰恰体现了它的 RSI 思路,让 AI Agent 不断提出假设、验证假设、记录失败,再把真正有效的方法沉淀到下一代模型中。







