
一个人一个月向生产环境提交2500个PR,代码全部由AI编写并自动合并,这件事已经在工程界真实发生了。
前Meta React团队核心成员、现任职于SpaceX AI与Cursor的Lauren Tan(网名Poteto),在最近的技术访谈中完整公开了这套体系的运行机制。

从最初每天微操单个AI导致精疲力竭,到现在手握十几个AI 军团全天候运转,他总结出了一套彻底颠覆传统软件工程的高速交付法则。
肉体代理人的困境与信任阶梯
离开Meta后,Lauren因为职业倦怠休息了一个月。
休假期间他开了一个新项目,尝试用AI写代码。
很快,他发现自己掉进了一个巨大的时间黑洞。
他每天花大量时间去微操一个AI,盯着终端里的每一步输出,手动复制错误信息,在浏览器开发者工具和代码编辑器之间来回倒腾。
他意识到自己成了最昂贵的肉体代理人。
AI无法直接感知运行结果,人类工程师就只能充当AI与运行环境之间的传话筒。
这个阶段的人类对AI缺乏信任,只能死死盯住每行代码,产出效率极低。
爬上信任阶梯的第一步,就是把人类从传话筒的位置上拿掉。
随着前沿大模型能力爆发,真正的开发瓶颈不再是AI能写出多复杂的算法,而是人类能否将自己的意图和愿景精确传达给模型。
行业内曾有人认为大模型会让垂直领域的专业经验贬值。
事实恰恰相反。
领域专家比以往任何时候都更有优势。
无论是医生、律师还是资深前端架构师,只要懂一点技术逻辑,能清晰表述业务规则和系统边界,就能通过语言精准驱动AI输出高质量成果。
自然语言正在成为新的编程语言。
人类输入的每个高信息密度词汇,都在大幅缩短意图传递的损耗。
抛弃软件工厂,建造米其林厨房
很多人喜欢用软件工厂来形容大规模AI编程,Lauren更倾向于使用米其林厨房这个概念。
工厂容易让人联想到粗制滥造和流水线堆砌,而优秀的软件工程离不开对质量和工艺的极致追求。
一个刚入行的家庭厨师,洗菜、切配、烹饪、洗碗全要一个人扛。
如果这时候突然往厨房塞进全家人帮忙,厨房只会彻底陷入混乱,因为没人知道工具放在哪里,工序也会互相打架。
真正的米其林主厨不会亲自去切每一瓣大蒜。
主厨更像是技术负责人,核心任务是设计菜单、制定标准化备料流程、规划食材供应链、采购最高效的专用厨具。
当主厨把整套厨房运转规则和标准打磨成熟,他就可以退居幕后,指挥多名副主厨协同作战。
甚至在不同城市复制出第二家、第三家连星级餐厅。
工程师的日常职责已经变了。
人类不需要亲自下场写每一行代码,人类的声誉和名字依然与最终交付的质量绑定。
搭建环境、定义技能、约束代码库,成了人类工程师的新核心工作。
闭环的核心:给AI装上眼睛和双手
要让副主厨独立工作,首要前提是验证能力。
Lauren在开源工具pstack以及内部研发体系中,把验证技能列为所有工具链中绝对排在第一位的核心能力。
没有验证,就不存在真正的自主闭环。
所谓的闭环,就是让AI自己写完代码后,能像真实人类用户一样去运行程序、点击界面、抓取性能火焰图、分析内存快照并自主排查报错。
当AI拥有了验证能力,才能实现爬山算法式的持续改进。
AI根据一套明确的评判标准不断修改代码,自己测试打分,直到跑出最优解。
为了支撑这个过程,Lauren专门开发了定制化的CLI工具。
在实际开发中,任务可以划分为确定性部分和非确定性部分。
判断架构设计、理解复杂业务逻辑属于非确定性任务,需要大模型消耗上下文去推理和判断。
机械的代码重构、格式转换、调用浏览器底层协议抓取报错,属于纯确定性任务。
很多开发者让AI每次都重新写脚本去测试,不仅速度慢,而且每次写出来的测试脚本风格各异,白白浪费上下文窗口。
把所有确定性的操作抽离出来,封装成底层的自动化脚本和CLI工具,只把需要主观判断的决策交给AI。
这样既能节约宝贵的上下文空间,又能保证执行结果绝对一致。
打造Dune框架:让写出坏代码在物理上变得不可能
如果代码库本身一团糟,AI生成代码的速度越快,屎山膨胀得就越迅猛。
Lauren在团队内部推动开发了名为Dune的内部应用开发框架。
这套框架专门针对桌面端环境设计,核心理念来自于TypeScript的类型收窄思维。
在优秀的类型系统中,通过类型守卫可以把宽泛的可能性精确锁定在唯一安全的区间内。
代码库的架构设计同样必须收窄AI的犯错空间。
Dune框架制定了极其严苛的静态检查规则和文件组织规范。
在项目早期,核心业务逻辑被塞在几个超过万行的单体巨型文件中,AI修改时经常顾此失彼。
重构后,所有功能模块必须存放在独立的特性目录中,由底层的服务发现机制统一注册。
整个代码库为每一种业务操作只提供唯一标准写法。
AI进入这个环境后,根本没有空间去自由发挥不良代码习惯。
一旦AI试图写出反模式或者把代码乱塞到不属于它的位置,严格的代码检查会在毫秒级时间内直接报错阻断。
人类工程师要做的,就是在旁边观察AI会在哪些地方跌倒。
每当发现AI反复犯同一种错误或者使用了拙劣的替代方案,就立刻退后一步思考,如何把这个痛点转变成一条新的规则,直接在代码库层面把犯错路径彻底封死。
外环与内环联动:2500个PR的自动化流水线
一个月2500个PR,绝对不是人类手动在聊天窗口输入2500次提示词。
这套体系依托于内外双环架构。
外环负责收集现实世界的动态上下文。
用户在沟通群里提的Bug、项目看板上的任务、社交平台上的用户反馈、甚至监控系统里的报警,都在代码库之外。
Lauren使用个人自动化智能体Grokbot作为外环连接器,全天候监听各个渠道的报错信息。
内环负责具体的工程实现。
Cursor等工具中的项目级协调智能体担任内环的调度中枢。
当外环捕获到一批相关的性能卡顿反馈时,它不会盲目地给每一个细碎反馈单独派一个AI去修,因为那会导致大量重复劳动和局部视角的修补。
外环会将结构化的上下文打包发送给内环的协调智能体。
协调智能体扮演AI幕僚长的角色。
它拥有独立的运行环境,不直接写代码,而是分析所有相关问题的共性,把大任务拆解成拓扑任务树,再分派给底下的多个执行智能体去攻坚。
除了处理外部Bug,系统内部还常态化运行着代码园丁任务。
专门的AI定期巡检代码库,排查潜在的代码反模式。
这些巡检结果不会立刻触发修改,而是先汇总沉淀到缓冲队列文档中。
人类和协调智能体每隔几天集中审视一次模式清单,从全局视角提炼出系统性的改进方案,避免在局部细节中迷失方向。
全自动审查与暗黑工厂
一个月产出几千个PR,人类不可能逐行审查每一份代码。
如果每个PR都需要人类排队人工确认,整个研发管道就会瞬间堵塞。
必须从第一天起就倒推流程:怎样才能让AI有资格自己合并代码?
Lauren的答案是建立高强度的自动化审查机制,用抽样代替阻塞。
进入全自动模式后,每个PR生成时都会自动派生出一组验证智能体。
这些智能体对新代码进行高强度的模糊测试,在模拟环境中疯狂调用界面组件,寻找潜在的性能衰退和逻辑漏洞。
验证通过后,代码直接自动合并入主分支。
这构成了某种意义上的暗黑工厂。
当人类工程师入睡后,十几个AI幕僚长带领着各自的执行舰队继续在性能优化、缺陷修复、原生重构等分支上连续运转。
工程师早上醒来,只需要打开提交日志,对已经合入的代码进行抽样复核。
这种模式天然适用于可被程序化验证的双向门场景。
哪怕合入的代码偶尔出现瑕疵,只要有完善的监控和快速回滚能力,撤销成本极低。
如果发现连续出现同类纰漏,工程师白天的工作就是调整规则、升级工具链,让流水线在下一个夜晚运转得更加平稳。
对于涉及数据丢失或不可逆变更的单向门业务,则依然需要结合形式化验证和更严格的人工门禁。
技能不是玄学,而是沉淀的工作流
很多开发者热衷于收集各种神级提示词,甚至争论谁的技能库更好用。
从本质上看,任何技能文件都只是一份Markdown格式的自然语言流程说明书。
它没有任何神秘代码,核心就是把抽象的人类经验具象化为清晰的执行步骤。
与其到处套用别人的现成模板,不如深挖自己的真实对话记录。
翻看过去几十次给AI纠错的记录,找出自己反复手动干预AI的那些节点,把这些教训提炼成结构化的规范,这就是最契合个人业务的最佳技能。
随着底层基础模型越来越强大,过往那些写满具体终端命令的冗长指令正在被淘汰。
最新的技能正在变得越来越薄,它们不再指导具体语法细节,而是专注于规范思维链路和工作流程。
打造一套适合自己的刀具,搭建一个规范极其严密的厨房,把确定性的脏活累活全部交给底层脚本,让AI在充分验证的闭环中自由奔跑。
当这套系统平稳运转起来时,一个人就能真正撑起一支由数十个AI精英组成的软件研发军团。
原对谈视频自行搜索:
LIVE: Poteto (creator of pstack) on shipping 1,000's of PR's a month at SpaceX
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)







