新解密文件显示微软高管曾称 AI 抓取为“人类历史上最大劳动盗窃”

2026年9月18日 · 第 7 期 · techcrunch.com

TechCrunch 报道,纽约时报三年前起诉 OpenAI 和微软的版权案中,新解密的法庭文件显示,微软高管私下将 AI 训练抓取行为称为“盗窃”,OpenAI 领导层也称其模型对出版商和记者构成“生存威胁”。文件还披露两家公司绕过付费墙、大规模抓取网页,并故意去除训练数据中的版权声明。

文件称 OpenAI 将完整 GPT-3 训练数据集交给微软,微软通过“Project Taxi”和“Project Mango”向 OpenAI 提供训练数据。Project Mango 数据集包含至少 160903 部新闻出版商作品。OpenAI 员工曾向 Brockman 报告“绕过纽约时报付费墙的黑客方法”,Brockman 回复“ah nice”。

OpenAI 构建的 WebText 和 WebText2 数据集大量依赖新闻抓取内容,还从 Common Crawl 提取数百万篇文章。研究人员刻意移除版权声明,理由是“不希望模型输出版权声明”。OpenAI 和微软未回应置评请求。这些新文件成为 AI 版权诉讼中的关键证据。