如果说有什么比被指控偷东西更尴尬的,那就是:你在自己的内部文件中早就承认了。
“全世界数百万人,很快就会把大模型‘吸干’他们作品的行为,视为一场人类史上最大规模的盗窃。”——这句话,不是出自哪位愤怒的作家或批评者之口,而是微软应用科学部门主管 Brent Hecht 在 2023 年 1 月一份内部备忘录里写下的。
最近,随着《纽约时报》起诉 OpenAI 和微软版权案的大量未删节法庭文件解封,科技巨头们长期以来坚称“AI 训练属于合理使用”的法律防线,正在被他们自己的内部言论一块块拆掉。


AI 一边“吃”内容,一边抢走内容的流量
事情要从2023 年《纽约时报》与 OpenAI、微软的版权大战说起。
2023 年,《纽约时报》起诉两家公司,指控其未经许可使用大量新闻内容训练生成式 AI 模型。OpenAI 和微软则主张,这类训练行为受到美国版权法“合理使用”(Fair Use)原则保护,模型并非简单复制原作品,而是经过训练后形成了具有新用途的系统。
这场官司一打就是三年,期间大量关键信息被两家公司以“商业机密”为由申请封存或涂黑——直到今年 9 月 17 日,美国纽约南区联邦法院终于解封了《纽约时报》等新闻出版商提交的简易判决书,那些此前被涂黑的段落才第一次公之于众。
结果,一公开就炸了。
例如,诉讼文件中显示,微软内部曾统计过一个相当直观的数据:与传统 Bing 搜索相比,微软 Copilot “答案引擎”带给《纽约时报》网站的点击率最高下降了 93%。也就是说,过去用户搜索到一篇新闻后,还需要点击链接进入《纽约时报》;现在,AI 可以直接把信息整理成答案,用户甚至不需要打开原网页。
对此,OpenAI 内部的一名软件工程师也有过非常直白的描述:
“不管我们把链接放得多么显眼,用户都不会点击。”
而 OpenAI ChatGPT 负责人 Nick Turley 更直接地写道,出版商正面临来自 AI 产品的“生存性威胁”,因为这些产品“很大程度上具有替代性”,而且随着能力提升,这种替代性还会越来越强。

微软内部称其为“死亡循环”
在 Brent Hecht 撰写的一份微软内部报告中,直接把这种局面描述为“死亡循环”(doom loop)。
原因很简单:如果用户可以直接向 AI 提问,并在 AI 产品里获得整理好的答案,那么他们就没有那么强的动力再点击原始新闻网站。但这又可能进一步减少媒体获得的流量和收入,最终让媒体减少内容生产,进而影响 AI 模型未来可以获得的高质量训练数据。
为此,Brent Hecht 在内部文件中写道:
“终端产品威胁其核心供应商的经济基础,这种情况‘非常不寻常’。但对于我们的 LLM 业务而言,这恰恰是我们围绕‘内容供应链’所创造出来的局面。”
在他看来,这不仅可能会影响新闻媒体,同时也可能“损害模型表现和整个互联网”。
换句话说,AI 公司正在面临一个相当尴尬的问题:模型越擅长替用户提供信息,用户越不需要访问原始网站;而原始网站如果因此失去收入,就可能减少内容生产,最终反过来影响 AI 模型的数据来源。

“史上最大规模的劳动力盗窃”,到底指什么?
如开头所说,Brent Hecht 在那份内部备忘录中写道,未来全球数以百万计的人会认为,大模型“吸走”他们创造的一切,是一种“规模惊人、前所未有的盗窃”,甚至是一场“人类历史上最大规模的劳动力盗窃”。
他还指出,几乎没有人希望自己创造的内容以这种方式被使用,也没人因此获得补偿。
这里的“劳动力”并不只是记者——新闻报道、书籍、博客、代码、图片等大量互联网内容,本质上都是人类投入时间和劳动创造出来的。而大模型的训练,需要从海量数据中学习语言、知识和表达方式。对于 AI 公司来说,这些数据是模型能力的基础;但对于内容创作者来说,它们同样代表着自己的劳动成果。
而此次文件披露的数据,也让这种规模有了更加直观的概念:
根据《纽约时报》提交的文件,OpenAI 部分“中期训练”(mid-training)数据集中,仅来自《纽约时报》、《每日新闻》以及调查报道中心的作品副本,就超过 91692 份。
另一个源自 Common Crawl 的数据集,仅从 nytimes.com 一个网站就包含超过 200 万份文档。
此外,微软和 OpenAI 还被指通过 Project Taxi、Project Mango 等项目交换和整理训练数据,Project Mango 数据集中据称包含至少 160903 份来自新闻出版商的独立作品。
说到这里,问题来了:这些内容、尤其是付费内容,究竟是如何进入AI 训练数据的?
根据诉讼文件显示,OpenAI 研究员 Nick Ryder 曾告诉联合创始人 Greg Brockman,自己找到了一个“绕过《纽约时报》付费墙的 hack”。对此,Brockman 只轻描淡写地回复了一句:“啊,不错。”
此外,文件还指称,OpenAI 曾构建 WebText、WebText2 等训练数据集,大量使用抓取而来的新闻内容,还同时从 Common Crawl 等开放网页数据集中获取了数百万篇文章。不仅如此,研究人员还曾有意删除其中的版权声明,因为他们不希望模型最终向用户输出这些“版权声明”。
对此,《纽约每日新闻》的律师 Steven Lieberman 说得很直白:“此次披露的证据首次表明,OpenAI 和微软一开始就知道自己所做的事情是错的。”

微软 CEO 也曾承认:付费内容应该获得授权
在此次曝光的材料中,还有一个有意思的反差。
微软 CEO Satya Nadella 在今年的证词中曾说,“任何处于付费墙后的内容,如果要用于 AI 训练或内容支撑,就应该获得授权”。他还表示,如果自己当时知道 OpenAI 使用了付费墙后的内容进行训练,他会“行使微软的权利,要求OpenAI 重新训练其模型”。
这两句话放在一起,意思很明确:如果我知道你干了这事,我会阻止你——可问题是:微软自己的 Bing 就是 OpenAI 抓取内容的渠道之一,Satya Nadella 是真的不知道吗?
不过,微软目前也强调,以上 Brent Hecht 的相关内部备忘录仅属于“员工的个人观点”,并不代表“公司立场”,并坚持在诉讼中主张,其对内容的使用符合版权法中的合理使用原则,并认为 Copilot 并不是新闻出版商内容的替代品。
这场版权官司最终会如何判,目前还是要交给法院;AI 训练是否属于合理使用,也不会因为几份内部文件就有定论。但至少,有一点已经很清楚了:
当一家公司的内部备忘录把自己的行为称为“人类历史上最大的劳动力盗窃”,当自己的数据证明产品让内容提供方的流量暴跌 93%,当自己的高管承认产品“具有替代性”——这个“合理使用”的辩护,可能也没有那么好打了。
那么,你对于这场版权官司,又有何看法呢?
参考链接:
https://www.404media.co/doom-loop-openai-and-microsoft-admits-llms-are-destroying-the-web-and-built-on-theft/
https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/

同时,我们整理了 《RSI(递归自我改进 / 自进化)前沿研究资料包》,汇总 OpenAI、Anthropic、Google、DeepSeek、智谱、Kimi、阿里等最新论文、官方技术报告与研究出处。







