AI公司,批量抢购旧书_数据_模型_ISBNdb

  发布时间:2026-08-08 22:14:35   作者:玩站小弟   我要评论
当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前“未被机器碰过”的训练数据。Anthropic的“ 。
AI公司,批量抢购旧书_数据_模型_ISBNdb
当AI生成材料占据互联网新发布材料的AI公司一半以上,优质人类文本成为稀缺资源。批量多家AI公司通过中间商大规模收购二手图书,抢购扫描后销毁,旧书只为获取2022年之前“未被机器碰过”的数据训练数据。Anthropic的模型“巴拿马方式划”曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。AI公司这不仅是批量数据争夺战,更揭示了AI产业的抢购题悖比如,它越成功,旧书赖以训练的数据人类数据就越稀缺。被切碎的模型旧书调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,AI公司切掉书脊、批量快捷扫描、抢购物理销毁。单次订单从1000本到100万本不等,书商们销量在数月内飙升了五倍。Anthropic内部文件显示,其“巴拿马方式划”(Project Panama)在一年内花费数千万美元购买了数百万本纸质书,拆解扫描后全部销毁。为什么AI公司关键花大价钱买旧书、拆书、毁书?答案指向一个它们自己制造的状况:互联网已经被AI生成材料污染了。斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网材料中AI生成的比例已超过一半(51.72%)。2022年ChatGPT发布之前,这个数字接近于零。Cloudflare的数据同样印证了一个趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。然而该数据研究的是HTTP请求数量而非人类实际阅读量,一个AI Agent单次可访问数千页面,而人类只需几次点击。当AI模型用AI生成的材料后续训练时,就会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合探究登上了Nature封面。探究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本,首先代输出还在讨比如建筑,第五代跑偏到语言翻译,第九代模型最初热情洋溢地验明正身各种不存在的兔子物种。从教堂到兔子,只用了九次往往代。展开全文递归训练下模型输出质量的退化趋势(基于Nature 2024封面比如文实验数据)比如文说明,驱动塌缩的是三类误差的复合效应:统方式近似误差(有限采样丢失尾部材料)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(改进算法本身带有结构偏差)。只关键其中任何一类存在,塌缩就不可避免。这是数学必然。Epoch AI的测算给出了清楚的时间窗,语言模型将在2026年到2032年间耗尽人类公开的优质文本数据。合成数据看似是解药,微软Phi-4、谷歌Gemma等模型都已混入合成数据,但据相关探究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出提高11.2%,这是指数放大的关系。理解了“模型塌缩”这个逻辑起点,才能理解AI公司为何愿意花数千万美元去购买那些“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的好处。”互联网新发布材料中AI生成材料占比变化(数据来源:斯坦福2026 AI指数报告)更棘手的是,作者们已经最初反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无意义但会让模型“中毒”的像素级修改。其文本领域的同类工具也在发展之中。Nightshade自2024年发布以来已被广泛下载。Anthropic联合英国AI安全探究所的探究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。这意味着互联网上爬取的数据无法保证“干净”,只有纸质书,从时间线上就天然免疫。但状况在于:旧书虽然纯净,获取方式却触发了另一场冲突。旧书争夺战ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,具有超过1.11亿本图书的目录材料。如今,它已将业务重点转向AI行业。其官网写方式:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它给予从1000本到100万本的批量采购,并承诺严格保密,每笔合作签署NDA,买家姓名永不披露。据404 Media报方式,采购订单有几个异常特点:采购对象几乎全部带有国际原则书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍不加区分;买家完全不在意价格,即使部分图书明显高于市场价,也会直接买下。一位书商向404 Media表示,过去一周只能卖出约20本书,近几个月每周销量飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常用的书就这样被粉碎。”被大量买走的书大多是“首先尾、冷门、几乎没有商业价值”的书籍,例如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术比如文集。这些不过版书籍因此更易被批量收购和销毁。Anthropic的巴拿马方式划给予了一个完善的标本。2024年初,该公司启动了这一严格保密的项目。内部文件写方式:“巴拿马方式划是我们对全世界所有图书开展破坏性扫描的努力。我们不想让人知方式我们在做这件事。”此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。今年1月的一篇报方式进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,详详见细数量在诉讼中存在争议),并向同事转发链接附言:“真是太按时了!!!”(just in time!!!)。CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。详详见细操作步骤:工人采取液压切割机切掉书脊,将散开的书页送入快捷生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,实现周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描常见会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方式划更快、更便宜。”ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它提议客户将这一表现重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,AI公司的数字化是消耗和训练,扫描后的材料进入私有数据库,公众无法访问。旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。买书合法,偷书不行2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一部分,他认定Anthropic的破坏性扫描表现属于“合理采取”(fair use),因为训练是“变革性”的。他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一部分,同一法官认定该公司在启动巴拿马方式划之前,曾下载了一个涵盖700万本盗版图书的数据库(LibGen),侵犯了版权。2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最后和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。这组判决传递了一个清楚的信号:买书、拆书、扫描、销毁,只关键书是合法购买的,法院可能不拦你;但如果你从盗版网站下载,代价会极其昂贵,每本侵权作品最高可判罚15万美元。由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。Anthropic的律师团队提出了双重辩护:其一,基于“首先次销售原则”,合法购买一本书后,所有权人有权对该副本开展任何处理;其二,叠加“合理采取”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权采取数百万本受版权保护的图书训练Gemini AI模型。与Anthropic案不一样,谷歌案的题在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内采取作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最后付出15亿美元代价;而巴拿马方式划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的馗正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。被锁进黑箱的人类智慧这场旧书争夺战揭示了一个悖比如:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。扫描后的数字材料进入AI公司的私有数据库,仅用于训练其模型,往往见不鲜公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的材料;AI公司的数字化是为了消耗和训练,材料进入私有数据库后公众无法访问。前者是知识的“放大器”,后者是知识的“黑洞”。在批量采购中,AI公司是否会区分往往见不鲜图书与珍贵或不过版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,地方史、土著语言文献、小语种著作等等,其中很多可能已经没有其他存世副本。当采购规模实现百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。对中小作者而言,打击同样真实。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前给予的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请不过级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是看着。几组题数据比较对中国AI从业者而言,挑战尤为严峻。据业内探究估方式,中文优质数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成材料,进一步加剧了数据污染。DeepSeek-V3需14.8万亿优质文本片段来训练,这个量级的中文优质数据,目前根本没有。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更不易的状况。这些隐忧指向一个更根本的状况:旧书是有限的,互联网上的AI生成材料是无限的。旧书耗尽之后,AI还能去哪里?旧书耗尽之后即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又关键从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的高效度,并没有处理根本状况。学术界正在探索多条出路。有探究说明,只关键真实数据在训练循环中持续存在(“往往积”而非“替换”范式),模型性能不会急剧恶化。独立探究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评比如快报》的探究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。但这些技术馗都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾是,AI的成功正在毁掉它赖以成功的数据,会因为技术改进而消失。我们需的不仅是更有效的数据获取方式,更是一套让技术发展与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积往往的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术状况,而是一个关于人类文明如何与人工智能共存的根本状况。(本文首先发钛媒体APP,作者 | AGI-Signal,编辑 | 焦燕)返回搜狐,查看更多平台声明:该文观点仅代表作者本人,搜狐号系材料发布平台,搜狐仅给予材料存储空间服务。
  • Tag:

相关文章

最新评论