为提升大模型训练的数据录入效率,人工智能领域巨头Anthropic采取了极端手段:直接销毁了上百万本实体书。
7月20日(当地时间),法院正式批准了Anthropic与作家群体达成的15亿美元和解协议。这一金额创下美国版权法历史上和解案的最高纪录。不过,相较于这笔巨额赔偿金,公众目光更多聚焦于Anthropic内部启动的一项“毁书计划”。
据法院披露的文件细节,Anthropic在2024年初启动了名为“巴拿马计划”的项目。公司投入数千万美元,从二手书商手中大量收购实体书。随后,这些书籍经过“破坏性扫描”处理:工业设备切开书脊,逐页扫描内容并录入数据库,最后将纸张彻底销毁。估算下来,已有200万册实体书因此化为乌有。
此举背后,折射出AI行业对高质量训练数据的白热化争夺。相较于互联网上海量低质、甚至由AI自行生成的内容,经由作者创作、编辑审核及出版流程层层筛选的书籍,无疑是大型语言模型最优质的信息宝库。而非破坏式扫描相比而言,耗时费力,“破坏性扫描”则在效率与成本上更具优势。
尽管法院认定Anthropic通过合法渠道购书用于大模型训练符合“合理使用”原则,但这种毁坏书籍的行径依然激起广泛争议。
作家集体诉讼揭开Anthropic“毁书计划”面纱
“巴拿马计划”之所以曝光,源于一起作家集体诉讼案。
2023年,美国恐怖小说家安德莉亚·巴茨(Andrea Bartz)意外发现,自己的作品出现在一个被Anthropic等AI公司广泛使用的训练文本库中。
她不愿看到自己苦心创作的成果被AI公司无偿“盗用”,进而构建起价值数十亿美元的商业帝国。2024年8月,在作家协会的支持下,巴茨联合其他作家向Anthropic提起集体诉讼。
随着司法调查深入,Anthropic的数据获取手段被彻底曝光。事实上,如今备受诟病的“破坏性扫描”,已是Anthropic在法律压力下被迫采取的一种成本更高的替代方案。
法院文件显示,为了获取高质量数据,Anthropic最初曾通过收集盗版电子书来建立数据库。
去年6月,法官裁定该公司将超过700万本盗版书籍存入“中央数据库”的行为侵犯了作家权利。但同时也确认,Anthropic使用合法渠道购买书籍进行模型训练,属于对作家作品的“合理使用”。
换言之,破坏性扫描本身不违法,违法的是盗版行为。
今年7月,Anthropic与一批作者达成总额15亿美元的和解协议。根据条款,每本符合条件的书籍版权所有者平均可获得约3000美元赔偿。这场历时两年的版权纠纷至此取得阶段性结果。
“破坏性扫描”争议远超法律范畴
尽管AI模型训练被视为对书籍的“合理使用”并获得法院支持,但“破坏性扫描”引发的争议早已突破法律边界。
公众最大的担忧在于,珍贵书籍可能在此过程中遭受不可逆的损毁。虽无确凿证据表明Anthropic已销毁具有特殊价值的珍稀图书,但当涉及数百万册书目时,人们仍担心部分珍贵的历史古籍和绝版书可能已进入AI训练供应链。
对AI公司而言,书籍的价值仅存于其中的文字数据。扫描过程中,它们未必能区分珍贵孤本与普通书籍的差异。然而,对于书商、收藏家、档案学者及历史研究者来说,实体书本身就是文化的一部分,其纸张质地、装帧设计、批注痕迹及流传经历,承载着无法被数字化内容替代的历史价值。
当然,也有观点支持AI公司对书籍的大规模扫描。他们认为,与其让大量冷门旧书长期沉睡在世界角落,不如借助人工智能系统,使其重新融入人类知识库。
但问题在于,AI公司的书籍数字化与公共机构推动的文化保存存在本质区别。扫描后的数据进入的是AI公司内部数据库,而非面向公众开放的公共图书馆。
Anthropic对实体书籍的物理销毁,更给人一种“斩草除根”的观感。这进一步加剧了人们对知识垄断的担忧,仿佛AI公司正将人类共有的知识遗产私有化为独家内部数据。
Anthropic行为引发广泛关注,或许还因为“毁书”这一行为所蕴含的象征意义及其带来的强烈负面观感。
在人类历史长河中,书籍长期被视为知识、记忆与文明传承的重要载体。保存书籍、传递思想与知识,某种程度上就是在延续文明脉络。而历史上的大规模毁书事件,无论是秦始皇时期的焚书,还是纳粹德国时期的焚书运动,往往都与权力控制、思想压制紧密相连。
因此,当大量实体书被切割、扫描并最终丢弃时,极易引发负面联想——Anthropic是否正在将原本属于全人类的文化遗产,转化为自身掌控的资源?
“毁掉书籍、投喂AI”这一极具象征意味的画面,可能与当下蔓延的AI恐慌产生共振。当一本本承载人类文明的书籍被切割、扫描,成为训练AI的“燃料”时,人们担心的或许不仅是某些书籍被销毁,而是人类亲手创造的机器最终会反噬自身。
撰文 | 李俊浩
编辑 | 北塱 钱琪瑶
