这套 AI 算不算落地,看它停在第几级
同一套模型,有人两周就让它在客户的生产流程里跑起来,有人做了半年还停在会议室投屏。差距不在模型参数,在部署能力。这份报告给了一把能量出差距的尺子:五级成熟度。第 1 级只算实验,风险是演示好看但上不了线;第 2 级 AI 进了真实流程,风险是权限和责任边界不稳。

《OpenAI FDE 研究报告》由清新研究团队在 2026 年 5 月发布,共 82 页,分成三段:定义与动因、Palantir 与本土团队的案例证据、成熟度与部署风险。报告里有一条组织侧的证据:OpenAI 收购 Tomoro,约 150 名有经验的 FDE 并入 Deployment Company。它是幻灯片报告,每页一张手绘信息图,翻起来比读文字快。下面只走成熟度这一条线,其余留在原件里。
报告还引了三组 BLS 就业数据给这条路背书:软件开发岗位到 2034 年增长 15%,年均空缺约 12.9 万个;计算机系统分析师增长 9%,约 3.4 万个;计算机与信息科学研究科学家增长 20%,约 3200 个。
01 交完蓝图,不算完成
报告第 10 页把 FDE 的岗位动作列了出来:discovery、scoping、system design、build、rollout。它要对生产结果负责,而不只是对方案负责。架构图交出去不是终点,谁能把原型推到稳定运行,谁才算接住了这件事。

02 五级成熟度,你现在站在哪一级
第 64 页到第 68 页,报告把落地拆成五级,每一级都配了主要风险。这五页是全文最值得拿走的部分,可以直接拿来对自己的项目:
L1 实验型|单点试验为主 风险:演示好看但上不了线,人工兜底多,价值尚未稳定量化 L2 嵌入式|AI 进入一个真实工作流 风险:权限和责任边界不稳定 L3 运营型|AI 成为日常运营系统的一部分 风险:反馈闭环断裂或异常恢复不足 L4 模式型|部署经验跨场景复用 风险:过度定制项目 L5 产品型|现场模式进入平台产品 风险:产品抽象失去现场适配能力

03 第 1 级卡在最后一步:上不了线
第 1 级的团队往往自我感觉不错:一周搭出流程,两天接上知识库,看起来已经能替人干活。报告给这一级标的原话是演示好看但不能上线。人工兜底越多,价值越难被量化,预算也就越难谈。
04 第 2 级卡在权限和边界
AI 进入一条真实工作流之后,问题从技术转向组织。第 65 页把这一级画成三个方块:数据与工具、AI 节点、真实用户与结果,压力全压在中间那道权限上。谁定义阈值、谁处理异常,得写进系统边界里,不能靠事后补。

05 第 3 级之后,风险换了方向
第 3 级要补日志、评测、回滚和监控。再往上,风险从能不能上线,换成能不能复用。

这里只走了成熟度一条线。第 69 到 72 页还有四组成效指标,第 73 到 76 页还有四类部署风险,第 59 到 63 页还有五个原创概念。
写在最后
这份报告能留下来的,是那张给自己打分的阶梯。今晚就能做的第一件事:把最近一个 AI 项目往五级里对一下,写清楚它停在第几级、风险是什么。部署本身就是产品,模型选型只是起点,能不能跑在真实流程里,才是分水岭。

清华出品:2026年OpenAIFDE研究报告.pdf







