- Published on
微软高管称AI抓取是“人类历史上最大规模的劳动盗窃”
- Authors
- Name
- pluc
- techcrunch.com

事件概述
近日,在《纽约时报》针对OpenAI和微软提起的版权诉讼中,新解封的法庭文件揭示了令人震惊的内部言论。据TechCrunch报道,微软一位高管私下将AI训练中的数据抓取行为称为“人类历史上最大规模的劳动盗窃”。这些文件首次披露了两家科技巨头如何系统性地绕过付费墙、剥离版权信息,并大规模抓取受版权保护的新闻内容来训练其AI模型。
核心指控:内部承认“盗窃”与“威胁”
根据诉讼文件,微软一位顶级高管在内部沟通中直言不讳地将公司的AI训练行为描述为“盗窃”。更关键的是,OpenAI自己的领导层也承认,其AI模型对训练数据来源的新闻出版商和记者构成了“生存威胁”。这些内部言论与两家公司长期以来主张的“合理使用”抗辩形成鲜明对比。
微软高管的“盗窃”定性
文件显示,微软应用科学总监Brent Hecht在2023年1月的一份内部备忘录中,将OpenAI和微软的行为称为“规模惊人的盗窃行为”和“人类历史上最大规模的劳动盗窃”。这一表述直接戳中了AI行业的核心伦理痛点:当AI模型通过抓取海量人类创作内容进行训练时,是否等同于无偿占有了这些创作者的劳动成果?
OpenAI的“生存威胁”承认
OpenAI的ChatGPT负责人Nick Turley在内部通信中写道,出版商面临来自ChatGPT等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着它们变得更好,将越来越具有替代性”。OpenAI总裁Greg Brockman也承认模型“非常擅长新闻”。这些言论直接削弱了AI公司声称其技术是“变革性”而非“替代性”的辩护。
绕过付费墙与剥离版权信息
诉讼文件详细描述了OpenAI和微软如何获取受版权保护的内容。最令人不安的指控之一是,OpenAI员工据称设计了一种“绕过《纽约时报》付费墙”的方法。当OpenAI研究员Nick Ryder向Brockman报告这个“黑客技巧”时,Brockman的回复是“啊,不错”。
大规模数据抓取
文件披露,OpenAI的中间训练数据集包含超过91,692份来自《纽约时报》、《每日新闻》和调查报道中心的受版权保护作品。一个基于Common Crawl的数据集仅从nytimes.com就抓取了超过200万份文档。此外,OpenAI和微软还通过“Project Taxi”和“Project Mango”等项目交换训练数据,其中Project Mango数据集包含至少160,903份来自新闻出版商的独特作品。
剥离版权信息的刻意行为
文件还描述了OpenAI员工在将数据输入模型前,刻意剥离版权信息的做法。研究人员表示,他们“不希望模型向用户输出版权声明”。这一行为直接违反了版权法中的署名权要求,也暴露了AI公司对创作者权利的系统性忽视。
对新闻出版商的实质性损害
诉讼文件提供了具体数据,展示了AI产品如何对新闻行业造成实质性损害。微软自己的数据显示,其Copilot“答案引擎”导致《纽约时报》域名的点击率相比传统必应搜索下降了高达93%。
“死亡螺旋”效应
微软内部演示文稿将这种点击率下降描述为“死亡螺旋”,认为这会“损害我们模型的性能以及整个网络”。文件引用微软文件称:“最终产品对其基本供应商的经济基础构成威胁,这是极不寻常的,但这就是我们为LLM业务在‘内容供应链’方面创造的现状。”
微软CEO的证词
微软CEO萨蒂亚·纳德拉在今年早些时候的证词中表示,“任何付费墙后的内容,任何想要使用它进行基础训练或训练的人都应该获得许可”。他还明确表示,如果他知道OpenAI抓取了付费墙后的信息,他会“援引微软的权利要求OpenAI重新训练其模型”。这一证词进一步证实了公司高层对不当行为的知情程度。
法律与伦理影响
这起诉讼的核心问题是AI公司是否可以合法使用受版权保护的材料来训练AI。目前,法院对此没有明确答案,但法官们大体上倾向于支持AI公司的“合理使用”论点。然而,这些新解封的承认与“合理使用”的关键要求——即使用不替代或损害原作市场——相矛盾。
对“合理使用”抗辩的冲击
OpenAI和微软的内部言论直接削弱了它们的“合理使用”抗辩。例如,纳德拉在宣誓下同意,与聊天机器人对话“已经替代了……直接在网站上提供信息,而不是需要访问原始来源”。这种语言表明,AI技术直接与原创作品竞争,而非对其进行变革性使用。
政府立场与行业反应
本月早些时候,特朗普政府提交了一份支持OpenAI未经许可使用受版权材料的简报。这一立场与新闻出版商和创作者的权益形成对立。与此同时,《纽约每日新闻》的律师史蒂文·利伯曼表示:“这里首次披露的证据表明,OpenAI和微软知道他们做错了。”
结论
这些新解封的法庭文件不仅揭示了AI行业最敏感的秘密,也引发了关于技术发展、知识产权和劳动价值之间平衡的深刻思考。当AI公司通过抓取人类创作内容来构建其模型时,它们是否应该对创作者进行补偿?这个问题没有简单的答案,但有一点是明确的:AI行业必须正视其数据来源的伦理和法律问题,否则将面临更广泛的信任危机。随着诉讼的推进,更多细节可能会浮出水面,进一步影响AI监管和版权法的未来走向。
原标题:Microsoft exec called AI scraping 'the largest theft of labor in human history'。 HN 原始发布时间:2026年9月18日星期五。当前记录为 865 分、764 条评论。