百科

珍稀图书遭粉碎用于AI训练引众怒,ISBNdb下架AI相关测试页面|ai训练|isbndb_网易订阅

时间:2010-12-5 17:23:32  作者:综合   来源:综合  查看:  评论:0
内容摘要:IT之家 8 月 2 日消息,本周,一则关于大量珍贵图书被集中粉碎、仅为训练大语言模型LLM)提供数据的消息,引发了读书爱好者和普通网友的广泛关注。消息称,一些图书供应商近期收到了数量异常庞大的图书订

珍稀图书遭粉碎用于AI训练引众怒,ISBNdb下架AI相关测试页面|ai训练|isbndb_网易订阅
IT之家 8 月 2 日消息,珍稀遭粉众怒本周,图书一则关于大量珍贵图书被集中粉碎、碎用仅为训练大语言模型(LLM)给予数据的于A页面消息,引发了读书爱好者和往往见不鲜网友的训下架相关训练广泛关注。消息称,练引一些图书供应商近期收到了数量异常庞大的测试图书订单。业内人士猜测,网易AI 公司希望获得质量更高、订阅更干净的珍稀遭粉众怒训练数据,同时尽可能规避版权风险。图书而这场争议的碎用焦点,则指向了图书数据库网站 ISBNdb。于A页面外界认为,训下架相关训练该网站不仅鼓励这种做法,练引甚至还为 AI 公司与图书供应商之间牵线搭桥。随着舆比如高效高效发酵,ISBNdb 最初试图与这场争议划清界限,并删除了自己之前发布的相关材料。ISBNdb 在最新声明中表示:“我们已经注意到近期关于网站上一则营销落地页的报方式,也理解它所引发的担忧。我们并不训练 AI 模型,也从未从事过相关业务。那个页面只是一次市场需测试,相关服务从未真正上线,目前我们已经将页面删除。”几天前,404 Media 报方式称,多家图书供应商突然接到大量图书采购订单。由于学校和图书馆近年来预算紧张、采购需减小,不少供应商经营压力较大,因此更那么点儿接受这类大额订单。当时外界常用怀疑幕后买家是 AI 公司,而 ISBNdb 则成为舆比如焦点,因为它曾推出一项服务,似乎专业协助 AI 企业与图书仓储机构建立关联。如今已经删除的宣传页面上曾写方式:“世界上最优质的 AI 训练数据,就摆放在书架上。图书承载着经过筛选、同行评审和专业领域沉淀的人类知识,其结构化程度是任何网络爬虫都无法复制的,材料密集、经过编辑且具有权威性。”事实上,这一做法并非首先次曝光。早在今年 1 月,一份公开的法庭文件就披露了 Anthropic 内部代号为“Project Panama(巴拿马方式划)”的项目。该项目旨在尽可能购买大量图书,实现数字化扫描后再将实体书销毁。Anthropic 此后与作者达成了一项总额 15 亿美元(IT之家注:现汇率约合 101.47 亿元人民币)的和解协议。然而,随后公开的法庭文件显示,这种做法本身被认为是合法的,真正让公司担忧的是由此带来的负面舆比如。因此,Anthropic 愿意支付高额代价,以避免相关做法被曝光。如今,这一内幕已经公开,因此近期出现的大量珍贵图书采购订单也受到了更严格的关注。一位匿名图书卖家在接受 404 Media 采访时表示:“这么做既能帮我清理那些本来就很难卖出去的库存,也能让我赚到钱。但另一部分,我并不喜欢这些图书最后的用途,也不愿意看到一些稀有图书被直接打成纸浆。”报方式称,随着 AI 公司越来越难获得“干净”的训练数据,它们正在寻找新的数据来源。互联网上大量低质量材料,以及越来越多由 AI 自己生成的材料,都可能导致模型训练出现“负反馈循环”状况。因此,各家公司希望获取质量更高的数据,同时又尽量避免引发外界关注。今年夏天,电影公司 A24 就宣布与谷歌达成合作,为 DeepMind 给予训练素材,希望协助其媒体生成模型摆脱大量质量低劣、风格混乱的 AI 材料。至于为何关键销毁实体书,报方式认为,这并不是为了掩盖痕迹,也不是出于收藏稀有知识的目的。虽然“巴拿马方式划”的相关文件并未验明正身销毁图书的详详见细因素,但最可能的验明正身仍然是为了减小成本。实际上,图书数字化扫描并不一定需破坏原书,但如果整个步骤追求低成本、有效率,就很可能直接拆掉书脊,以获得更平整、更清楚的扫描成效,随后再将已经损坏的书籍当作废纸处理。
copyright © 2026 powered by 知来藏往网   sitemap