美国当地时间 9 月 17 日,《纽约时报》及其他新闻机构向法院提交了解封版简易判决动议,一批此前被隐去的内部言论首次公开。这起始于 2023 年 12 月的版权诉讼已并入多区诉讼,由一位联邦法官统一审理,正进入简易判决(summary judgment)阶段;案件核心是 OpenAI 与微软能否以“合理使用”为由,用受版权保护的新闻文章训练模型。

[1]

最尖锐的证词来自微软内部。应用科学总监布伦特·赫克特在 2023 年 1 月的备忘录中写道,把数以百万计的新闻文章未经许可复制进大模型,可能构成“一场规模空前的惊人盗窃”和“人类历史上最大规模的劳动力盗窃”;他 2024 年 1 月的内部演示又警告,微软 Copilot“答案引擎”正在制造一个“厄运循环”——公司数据显示,使用 AI 回答工具的用户对《纽约时报》等出版方页面的点击率较传统搜索低 83% 至 93%。诉讼文件引用的一份微软文档写道:“最终产品威胁到其关键供应商的经济基础,这是极不寻常的,但这就是我们为 LLM 业务的‘内容供应链’创造的现状。”微软周四回应称,这些言论“反映的是员工的个人观点,并非法律分析”。

[1][2]

OpenAI 一侧同样被文件钉住。ChatGPT 负责人尼克·特利曾写道,AI 产品对出版商构成“生存威胁”,“在很大程度上具有替代性,就是这样,而且随着它们变得更好,替代性会越来越强”。联合创始人、现任总裁格雷格·布罗克曼约在 2017 年写道,他“被那些天文数字般的财富深深驱动”;当员工尼克·赖德告知他有“绕过《纽约时报》付费墙的方法”时,布罗克曼回了两个字:“啊,不错。”

规模数字首次公开:OpenAI 中期训练数据集中含 91,692 份原告(《纽约时报》《纽约每日新闻》与调查报道中心)作品的副本;一个基于 Common Crawl 的数据集包含 nytimes.com 域名下逾 200 万份文档;与微软合作的 Project Mango 数据集中至少有 160,903 篇来自新闻出版商的独特作品。微软 CEO 萨蒂亚·纳德拉在证词中表示,付费墙内的内容应经授权才能用于训练,若当时知晓 OpenAI 抓取了付费墙内容,他将行使协议权利,要求 OpenAI 重新训练模型。

[1][2]

“合理使用”四要素中的第四项——使用是否替代原作品、损害其市场——正是这些内部言论的落点。原告律师史蒂文·利伯曼称,新证据表明 OpenAI 与微软“明知自己的做法有问题”。特朗普政府已于 9 月 1 日提交法庭之友意见书,支持 AI 训练具有“强转换性”;据多家媒体统计,同一天约 400 家美国地方报纸对两家公司提起集体诉讼。

简易判决的结果将决定哪些诉求进入正式庭审。而对 OpenAI 和微软来说,最危险的或许不是法律条文,而是公司自己的高管用“盗窃”和“替代”写下的内部记录——在衡量市场损害的法庭上,它们比任何外部证人证词都更有分量。

[1][2]
上午的律师事务所里,律师背影站在堆满文件箱、法律卷宗与旧报纸合订本的桌前翻阅法庭文件,一侧是服务器机柜,窗外是城市天际线。AI 生成插画,非新闻照片。
律师事务所的上午:旧报纸堆、文件箱与服务器机柜并置, AI 生成插画,非新闻照片