Anthropic 那起被戏称为“当代焚书坑儒”的诉讼案,总算有了定论。有意思的是,在这场法律博弈里,最像“焚书”的那部分操作,反而成了唯一站得住脚的一环。
从 2024 年 8 月立案,到这个月 20 号尘埃落定,这场拉扯了近两年的集体诉讼终于画上了句号。法院最终拍板,Anthropic 需向原告支付 15 亿美元的和解金。
这笔钱有多烫手?咱们不看那些虚高的 ARR 数据,单看路透社此前的报道:Anthropic 在 2023 到 2025 这两年间,实际营收也就 50 亿上下。这一刀下去,基本是切到了大动脉。出血量如此之大,Anthropic 算是给整个 AI 行业开了个杀鸡儆猴的头筹。
出了这种大事,世超赶紧去扒了扒判决书,发现里头确实有不少值得细品的细节。
这一切的伏笔,还得从他们自己递出去的“刀子”说起。
早在 2021 年 12 月,Anthropic 就发表过一篇论文,详细披露了一款早期大模型的训练数据来源。那时候的数据,主要靠爬取 Common Crawl 网页以及网络书籍获取。
其中,引用区里一个叫 The Pile 的数据集格外扎眼。因为当时,The Pile 下有个子集叫 Books3。
Books3 囊括了近 20 万本无版权电子书。可以说,几乎市面上所有的大模型都拿它练过手。如今,Books3 早已明令下架,成了圈内心照不宣的秘密。
不过彼时 Anthropic 还披着学术研究的外衣,在版权方眼里,顶多先拿小本本记上一笔。
真正把 Anthropic 推向风口浪尖的,是 2024 年媒体对企业利用 The Pile 训练模型发起的深度调查。
面对记者的连环追问,Anthropic 发言人不得不承认:商业模型 Claude 确实使用了包含侵权内容的 The Pile 进行训练。
这下版权方彻底炸锅了。意思是:你非法搬运我的作品,靠训练出的模型赚得盆满钵满,甚至还要抢我的饭碗,到头来我连一分钱分成都拿不到?
于是,三名作家代表数十万版权人,直接对 Anthropic 提起了诉讼,造就了这起史上规模最大的 AI 版权案。
随着案件正式立案,原告获得了深入 Anthropic 内部调查的机会。结果这一查,才发现 Books3 那几十万本根本不算啥,里面还有 LibGen、PiLiMi 等渠道的资源,加起来至少有七百万本非法下载的无版权书籍!
同时,这也牵扯出本案槽点最大、却唯独合法的操作:花费数百万美元购买纸质书,经过去皮切页、破坏性扫描构建数据库……
2024 年,Anthropic 曾意识到用盗版书训练模型的法律风险。为此,他们开始采购纸质书,扫描入库制成数据集后立即销毁,且规定该数据集仅限公司内部用于模型训练,严禁外传。
这套操作完美契合美国版权法中的“首次销售原则”——只要你买下了第一次,之后如何处置随你便,只要不产生新的副本即可。
但若上升到 AI 常挂在嘴边的“人类文明传承”高度,其实完全没必要做得如此极端。毕竟 Google Books 早有先例,人家扫描完整图书且保留纸书原件,法院依然认定属于合理使用。
但为了规避法律风险(更可能是因为破坏性扫描成本最低、最便捷),AI 还是选择了将书砍成一页页纸张,直接塞进扫描仪。
一边呼吁控制 AI 发展速度,一边停不下扫书毁书训模型的手,这种正反打的操作,Anthropic 算是玩明白了。
消息一经披露,瞬间点燃公众怒火。相关讨论帖在社交媒体上的浏览量突破两千万,评论区骂声已近四千楼。
不少专家学者也出面谴责,认为 Anthropic 此举极其不地道。谁也无法保证被销毁的书里,没有珍稀孤本。
有二手书商在接受采访时透露,其库存中有很多罕见、绝版或外语书籍,其中一些被销毁的,恰恰是目前流通市场上最后的几本。
况且有些书籍本身即是艺术品,Anthropic 将其数字化后内容被封存,这难道是要独占人类文明吗?
这回,“历史罪人”和“知识垄断商”的帽子,结结实实地扣在了 AI 头上。连马斯克都没忍住,出来踩了一脚。
更具讽刺意味的是,这唯一合法的操作,恰恰向法官证明了 Anthropic 懂版权法。既然清楚如何规避风险,那此前下载盗版书的行为,便是明知故犯,罪加一等。
坏事做尽,终究迎来了恶报。
目前案件已进入判决后的上诉期。在被侵权的作品中,已有 91.3% 申领了赔偿,若判决顺利执行,每本书可获得 3000 美元和解金。
值得注意的是,这场天价官司中获利最丰的,竟是原告律师。起初律师要求抽取和解金的 20%,即整整 3 亿美元。
法院觉得过分,将其砍至 1 亿美元。即便如此,世超仍觉离谱——一场官司赚到的钱,恐怕是我这辈子都没见过的数目。
当然,即便 Anthropic 已被各方狠狠砍了一刀,这大概率不是其为版权支付的最后一笔费用。不少放弃集体诉讼的版权方,仍在单独与 Anthropic 对簿公堂。
但此次判决,无疑为其他未决的 AI 版权案打了个样。没有漫长的法庭拉锯,也没有对科技巨头的偏袒,法院判决果断干脆,主打一个“先分钱再说”,拖延对谁都没好处。
截至今日,Anthropic 盗版书集体诉讼案暂告一段落,但 AI 与版权的争议远未终结。
AI 究竟能否在未获授权的情况下,拿真人创作者的作品进行训练?
若 AI 生成的内容复刻了真人作品的风格与表达,是否构成侵权?
一旦坐实侵权,责任又该由谁来承担?
我们到底该如何在 AI 发展与人类权益之间,找到平衡点?
比起超级智能、灾难性风险、人类长期福祉这些即便签一百份协议也难以解决的宏大命题,AI 企业不如回头看看,在这场无人愿主动退出的竞赛中,有哪些问题可以摸着良心先解决掉。
撰文:莫莫莫甜甜
编辑:江江 & 面线
美编:素描
图片、资料来源:
路透社、X、404 media、arxiv、
https://storage.courtlistener.com/recap/gov.uscourts.cand.434709/gov.uscourts.cand.434709.680.0_5.pdf
