一边让全世界的程序员、写作者和职场人「多用 AI」,另一边,负责训练 AI 的人却因为用了 AI,被直接踢出项目——这听起来像一个段子,但据 404 Media 最新调查,它确实发生在 OpenAI 的模型训练体系里。
本周 404 Media 披露,多名参与 OpenAI AI 模型训练的外包人员,因为在工作过程中使用 AI,被解雇或移出项目。有意思的是,他们的工作本身就是阅读真实用户与 ChatGPT 的对话、评价 AI 回答,再把这些人工判断反馈给模型。
而这场“训练 AI 的人不能用 AI“的冲突,也让此前OpenAI曝光的「Project Lily」浮出水面。


第一类人:每天给 ChatGPT 的回答「打分」
要理解这件事,首先得知道这些外包人员到底在干什么。
9 月中旬,404 Media 曾曝光 OpenAI 内部代号为「Project Lily」的项目。根据其获得的内部文件,OpenAI 会让数百名外包人员阅读真实 ChatGPT 用户提交的 Prompt甚至完整对话,然后对 ChatGPT 的回答进行评分。他们需要判断 AI 的回答是否准确、是否过度迎合用户,以及有没有把 ChatGPT 说得太像一个“真人”等。
简单来说,这就是一种典型的人工反馈流程:AI 生成回答,人类负责判断这个回答到底好不好,再把结果反馈给模型。
而这项工作规模并不小。根据 404 Media 此次获得的另一份内部文件显示,OpenAI 某些相关项目的参与者规模甚至可能超过 1 万人。虽然这并不代表所有人都在做 Project Lily,但足以说明,人类外包劳动依然是大型 AI 模型训练体系中的重要一环。
更值得注意的是,这些人处理的并不一定是 OpenAI 专门编造的测试数据,而可能是真实用户提交给 ChatGPT 的内容。此前关于 Project Lily 的报道指出,经过隐私过滤后,部分敏感信息仍可能出现在审核人员看到的内容中。
对此,OpenAI 的回应是:承认过滤器可能漏掉罕见标识符或模糊的私密表述——换句话说,你用来当树洞、当心理咨询师的那些对话,可能正在被大洋彼岸的某个承包商细细品读。

第二类人:专门检查第一类人有没有「偷偷用 AI」
除了直接评价 ChatGPT 回答的人员之外,OpenAI 相关项目还有另一类外包人员:他们负责审核其他外包人员的工作。
这两类人的工作并不是一回事:
● 前者负责「训练数据」:看 ChatGPT 的回答 → 评价质量 → 提供人工反馈。
● 后者负责「质量监督」:看外包人员提交的工作 → 判断是否符合要求 → 检查有没有违规使用 AI。
而 404 Media 获得的一份内部工作指南明确规定,后者同样不能使用 AI。文件写道,审核人员不得使用 AI 检测工具,也不得自己使用 AI;包括 Grammarly 和 AI 翻译工具在内,也不能用于撰写反馈、评论或完成审核工作。
原因很简单:如果负责抓 AI 的审核人员自己也依赖 AI,那么这套监督机制就失去了意义。
因此,整个流程实际上变成了:训练人员负责给 AI「打分」,审核人员负责检查训练人员有没有违规——而两类人,都必须证明自己的工作来自本人。
这也解释了,为什么审核人员会拿到一份专门的「AI 使用痕迹」指南:他们需要留意一些可能意味着 AI 参与的特征,包括重复性措辞、明显的 AI 写作风格,以及工作完成速度异常快等。甚至连标点符号都可能成为判断依据,例如过度使用破折号等。
不过,这份内部文件也提醒审核人员,不要依赖单一线索,也不要用 GPTZero 等 AI 检测工具来直接判断,而是要关注整体,不能看到某一个符合的特征就下草草下结论。

「我只是需要一点帮助」,最后却丢了工作
404 Media 采访的几名外包人员中,有人承认自己曾在参与 OpenAI 模型训练时使用 AI。
其中一人甚至向媒体提供了一封据称是自己的解雇通知。通知称,雇主发现其工作存在「真实性」(Authenticity)方面的问题。这名外包人员表示:“我不是一个坏人,也不是一个糟糕的员工。我只是需要一点帮助,于是向 AI 寻求支持,但最终却因此走向了失败。”
他还坦言,自己已经无法从这份工作中感受到快乐,也觉得自己没有真正为社会作出贡献。
另外,在 404 Media 采访的人员中,还有 2 人曾为 Mercor 工作——Mercor 是一家 AI 训练公司,负责招募专家和外包人员,让他们参与包括 ChatGPT 在内的 AI 模型训练工作。
而对于外包人员使用 AI 的问题,Mercor 发言人也向媒体表示,公司招聘这些专家,看重的正是他们的专业知识和判断能力,合同明确禁止使用LLM完成项目,并会通过工具和系统检测违规行为。一旦确认工作人员使用 AI 完成任务,公司会立即将其移出项目。

AI 越会干活,训练 AI 的人反而越不能让 AI 干活?
截至目前,OpenAI 暂未就外包人员因使用 AI 被解雇一事作出回应。
而这起事件有意思的地方,并不只是「训练 AI 的人不能用 AI」,而是它实际上暴露了 AI 产业正在面对的一个现实问题:当 AI 成为越来越多人的生产力工具时,哪些工作仍必须由人亲自完成?
对于普通办公人员来说,用 AI 润色一句话、翻译一段文字,可能只是效率问题;但对于训练 AI 的人来说,情况完全不同:因为他们的「人类判断」本身就是产品的一部分。
如果本来负责告诉模型“这个答案好不好”的人,让另一个 AI 替自己做了判断,那么训练数据的来源就发生了变化;如果这种 AI 生成内容又被拿去训练下一代模型,就可能进一步引发人们对所谓“模型崩溃”的担忧——即模型反复学习 AI 生成的数据后,输出质量将逐渐下降。
所以,这场看似荒诞的「AI 禁令」,其实也是 AI 产业的一道新难题:AI 越来越擅长替人完成工作,AI 公司却必须想办法确保,在最关键的训练环节里,人类还没有被 AI 替掉。
而这,或许也是 AI 进入大规模生产之后,一个越来越难绕开的悖论。
参考链接:https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai/

同时,我们整理了 《RSI(递归自我改进 / 自进化)前沿研究资料包》,汇总 OpenAI、Anthropic、Google、DeepSeek、智谱、Kimi、阿里等最新论文、官方技术报告与研究出处。







