数百万本二手书籍完成数字化后将实体图书销毁
近日有调查报道显示,多家头部AI企业正通过中间商秘密采购数百万本二手书籍,扫描提取内容作为AI模型训练数据,完成数字化后将实体书销毁。
AI模型训练需要大量高质量的原创数据,但目前网络上存在大量低质量AI生成内容,会污染训练数据池,影响模型训练效果。因此AI企业将目光转向2022年之前出版的纸质印刷书籍,这类内容大多为人类原创,受AI生成内容污染的概率更低。
此前已有相关案例出现,AI企业Anthropic曾投入数百万美元,采购大量纸质书籍提取信息训练Claude模型,扫描后将实体书销毁,该公司曾因存储700万本盗版书籍用于训练,被处以15亿美元罚款。近期也有出版联盟起诉Google,指控其非法使用数百万本版权书籍训练Gemini模型。
据书籍数据库平台ISBNdb的数据,今年4月起二手书批量订单明显增长,单笔订单规模从1000本到100万本不等,采购没有特定的题材、类型或作者倾向,且采购方对价格不敏感,即使溢价也会直接购买。有二手书卖家透露,此前销量好时每周能卖出约20本书,近期每周销量暴涨至数百本,是常规销量的五倍,其他二手书平台也出现了类似的批量订单增长。
为了提高效率、降低成本,AI企业大多选择破坏性扫描方案,拆除书籍装订后将单页送入高速工业扫描仪扫描,最终导致数百万本实体书被销毁。目前争议主要集中于两方面:一是AI企业扫描过程中是否会筛选稀有或绝版书籍,这类书籍退出流通可能造成公共文化资源损失;二是扫描后的书籍内容会进入私有数据库用于AI训练,普通公众无法访问,相关知识不能被社会共享。
声明:本网站发布的内容(图片、视频和文字)以原创、转载和分享网络内容为主,如果涉及侵权请尽快告知,我们将会在第一时间删除。文章观点不代表本网站立场,如需处理请联系客服。电话:133-2181-3167。
本站全力支持关于《中华人民共和国广告法》实施的“极限化违禁词”的相关规定,且已竭力规避使用“违禁词”。故即日起凡本网站任意页面含有极限化“违禁词”介绍的文字或图片,一律非本网站主观意愿并即刻失效,不可用于客户任何行为的参考依据。凡访客访问本网站,均表示认同此条款!反馈邮箱:jason.sun@bsenvir.com.cn。