Token导航 LogoToken导航

SpaceX AI工程师单月合并2500个生产PR自动化机制

更新时间 2026-10-05来源 AI寒武纪正文 3599字阅读约 12分钟2 张图片
图片

一个人一个月向生产环境提交2500个PR,代码全部由AI编写并自动合并,这件事已经在工程界真实发生了。

前Meta React团队核心成员、现任职于SpaceX AI与Cursor的Lauren Tan(网名Poteto),在最近的技术访谈中完整公开了这套体系的运行机制。

图片

从最初每天微操单个AI导致精疲力竭,到现在手握十几个AI 军团全天候运转,他总结出了一套彻底颠覆传统软件工程的高速交付法则。

肉体代理人的困境与信任阶梯

离开Meta后,Lauren因为职业倦怠休息了一个月。

休假期间他开了一个新项目,尝试用AI写代码。

很快,他发现自己掉进了一个巨大的时间黑洞。

他每天花大量时间去微操一个AI,盯着终端里的每一步输出,手动复制错误信息,在浏览器开发者工具和代码编辑器之间来回倒腾。

他意识到自己成了最昂贵的肉体代理人。

AI无法直接感知运行结果,人类工程师就只能充当AI与运行环境之间的传话筒。

这个阶段的人类对AI缺乏信任,只能死死盯住每行代码,产出效率极低。

爬上信任阶梯的第一步,就是把人类从传话筒的位置上拿掉。

随着前沿大模型能力爆发,真正的开发瓶颈不再是AI能写出多复杂的算法,而是人类能否将自己的意图和愿景精确传达给模型。

行业内曾有人认为大模型会让垂直领域的专业经验贬值。

事实恰恰相反。

领域专家比以往任何时候都更有优势。

无论是医生、律师还是资深前端架构师,只要懂一点技术逻辑,能清晰表述业务规则和系统边界,就能通过语言精准驱动AI输出高质量成果。

自然语言正在成为新的编程语言。

人类输入的每个高信息密度词汇,都在大幅缩短意图传递的损耗。

抛弃软件工厂,建造米其林厨房

很多人喜欢用软件工厂来形容大规模AI编程,Lauren更倾向于使用米其林厨房这个概念。

工厂容易让人联想到粗制滥造和流水线堆砌,而优秀的软件工程离不开对质量和工艺的极致追求。

一个刚入行的家庭厨师,洗菜、切配、烹饪、洗碗全要一个人扛。

如果这时候突然往厨房塞进全家人帮忙,厨房只会彻底陷入混乱,因为没人知道工具放在哪里,工序也会互相打架。

真正的米其林主厨不会亲自去切每一瓣大蒜。

主厨更像是技术负责人,核心任务是设计菜单、制定标准化备料流程、规划食材供应链、采购最高效的专用厨具。

当主厨把整套厨房运转规则和标准打磨成熟,他就可以退居幕后,指挥多名副主厨协同作战。

甚至在不同城市复制出第二家、第三家连星级餐厅。

工程师的日常职责已经变了。

人类不需要亲自下场写每一行代码,人类的声誉和名字依然与最终交付的质量绑定。

搭建环境、定义技能、约束代码库,成了人类工程师的新核心工作。

闭环的核心:给AI装上眼睛和双手

要让副主厨独立工作,首要前提是验证能力。

Lauren在开源工具pstack以及内部研发体系中,把验证技能列为所有工具链中绝对排在第一位的核心能力。

没有验证,就不存在真正的自主闭环。

所谓的闭环,就是让AI自己写完代码后,能像真实人类用户一样去运行程序、点击界面、抓取性能火焰图、分析内存快照并自主排查报错。

当AI拥有了验证能力,才能实现爬山算法式的持续改进。

AI根据一套明确的评判标准不断修改代码,自己测试打分,直到跑出最优解。

为了支撑这个过程,Lauren专门开发了定制化的CLI工具。

在实际开发中,任务可以划分为确定性部分和非确定性部分。

判断架构设计、理解复杂业务逻辑属于非确定性任务,需要大模型消耗上下文去推理和判断。

机械的代码重构、格式转换、调用浏览器底层协议抓取报错,属于纯确定性任务。

很多开发者让AI每次都重新写脚本去测试,不仅速度慢,而且每次写出来的测试脚本风格各异,白白浪费上下文窗口。

把所有确定性的操作抽离出来,封装成底层的自动化脚本和CLI工具,只把需要主观判断的决策交给AI。

这样既能节约宝贵的上下文空间,又能保证执行结果绝对一致。

打造Dune框架:让写出坏代码在物理上变得不可能

如果代码库本身一团糟,AI生成代码的速度越快,屎山膨胀得就越迅猛。

Lauren在团队内部推动开发了名为Dune的内部应用开发框架。

这套框架专门针对桌面端环境设计,核心理念来自于TypeScript的类型收窄思维。

在优秀的类型系统中,通过类型守卫可以把宽泛的可能性精确锁定在唯一安全的区间内。

代码库的架构设计同样必须收窄AI的犯错空间。

Dune框架制定了极其严苛的静态检查规则和文件组织规范。

在项目早期,核心业务逻辑被塞在几个超过万行的单体巨型文件中,AI修改时经常顾此失彼。

重构后,所有功能模块必须存放在独立的特性目录中,由底层的服务发现机制统一注册。

整个代码库为每一种业务操作只提供唯一标准写法。

AI进入这个环境后,根本没有空间去自由发挥不良代码习惯。

一旦AI试图写出反模式或者把代码乱塞到不属于它的位置,严格的代码检查会在毫秒级时间内直接报错阻断。

人类工程师要做的,就是在旁边观察AI会在哪些地方跌倒。

每当发现AI反复犯同一种错误或者使用了拙劣的替代方案,就立刻退后一步思考,如何把这个痛点转变成一条新的规则,直接在代码库层面把犯错路径彻底封死。

外环与内环联动:2500个PR的自动化流水线

一个月2500个PR,绝对不是人类手动在聊天窗口输入2500次提示词。

这套体系依托于内外双环架构。

外环负责收集现实世界的动态上下文。

用户在沟通群里提的Bug、项目看板上的任务、社交平台上的用户反馈、甚至监控系统里的报警,都在代码库之外。

Lauren使用个人自动化智能体Grokbot作为外环连接器,全天候监听各个渠道的报错信息。

内环负责具体的工程实现。

Cursor等工具中的项目级协调智能体担任内环的调度中枢。

当外环捕获到一批相关的性能卡顿反馈时,它不会盲目地给每一个细碎反馈单独派一个AI去修,因为那会导致大量重复劳动和局部视角的修补。

外环会将结构化的上下文打包发送给内环的协调智能体。

协调智能体扮演AI幕僚长的角色。

它拥有独立的运行环境,不直接写代码,而是分析所有相关问题的共性,把大任务拆解成拓扑任务树,再分派给底下的多个执行智能体去攻坚。

除了处理外部Bug,系统内部还常态化运行着代码园丁任务。

专门的AI定期巡检代码库,排查潜在的代码反模式。

这些巡检结果不会立刻触发修改,而是先汇总沉淀到缓冲队列文档中。

人类和协调智能体每隔几天集中审视一次模式清单,从全局视角提炼出系统性的改进方案,避免在局部细节中迷失方向。

全自动审查与暗黑工厂

一个月产出几千个PR,人类不可能逐行审查每一份代码。

如果每个PR都需要人类排队人工确认,整个研发管道就会瞬间堵塞。

必须从第一天起就倒推流程:怎样才能让AI有资格自己合并代码?

Lauren的答案是建立高强度的自动化审查机制,用抽样代替阻塞。

进入全自动模式后,每个PR生成时都会自动派生出一组验证智能体。

这些智能体对新代码进行高强度的模糊测试,在模拟环境中疯狂调用界面组件,寻找潜在的性能衰退和逻辑漏洞。

验证通过后,代码直接自动合并入主分支。

这构成了某种意义上的暗黑工厂。

当人类工程师入睡后,十几个AI幕僚长带领着各自的执行舰队继续在性能优化、缺陷修复、原生重构等分支上连续运转。

工程师早上醒来,只需要打开提交日志,对已经合入的代码进行抽样复核。

这种模式天然适用于可被程序化验证的双向门场景。

哪怕合入的代码偶尔出现瑕疵,只要有完善的监控和快速回滚能力,撤销成本极低。

如果发现连续出现同类纰漏,工程师白天的工作就是调整规则、升级工具链,让流水线在下一个夜晚运转得更加平稳。

对于涉及数据丢失或不可逆变更的单向门业务,则依然需要结合形式化验证和更严格的人工门禁。

技能不是玄学,而是沉淀的工作流

很多开发者热衷于收集各种神级提示词,甚至争论谁的技能库更好用。

从本质上看,任何技能文件都只是一份Markdown格式的自然语言流程说明书。

它没有任何神秘代码,核心就是把抽象的人类经验具象化为清晰的执行步骤。

与其到处套用别人的现成模板,不如深挖自己的真实对话记录。

翻看过去几十次给AI纠错的记录,找出自己反复手动干预AI的那些节点,把这些教训提炼成结构化的规范,这就是最契合个人业务的最佳技能。

随着底层基础模型越来越强大,过往那些写满具体终端命令的冗长指令正在被淘汰。

最新的技能正在变得越来越薄,它们不再指导具体语法细节,而是专注于规范思维链路和工作流程。

打造一套适合自己的刀具,搭建一个规范极其严密的厨房,把确定性的脏活累活全部交给底层脚本,让AI在充分验证的闭环中自由奔跑。

当这套系统平稳运转起来时,一个人就能真正撑起一支由数十个AI精英组成的软件研发军团。

原对谈视频自行搜索:

LIVE: Poteto (creator of pstack) on shipping 1,000's of PR's a month at SpaceX

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多