尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AirTag追踪揭示:亚马逊销毁稀有书籍训练AI

AirTag追踪揭示:亚马逊销毁稀有书籍训练AI 据Ars Technica报道一名独立调查人员通过苹果AirTag追踪设备意外发现亚马逊内部存在一个隐秘计划为了训练人工智能模型亚马逊的一个团队正在系统性地销毁大量稀有和珍贵的书籍。这一发现迅速引发科技界与文化界的热议。一次意外追踪调查人员最初只是在一批旧书箱中放置了一枚AirTag想追踪旧物流链的流向。然而信号最终指向了亚马逊位于俄勒冈州的一座仓储设施。透过废弃包装和工作人员透露的信息一个名为“Corpus Cleanup”的项目浮出水面。该项目专门负责将图书馆淘汰的实体书进行扫描和数字化但在完成数据提取后这些纸质书往往会被当作废品处理而其中不乏稀有的初版书、限量印刷品甚至带有作者手写批注的珍藏本。消息人士称销毁流程非常高效先由机械臂扫描每一页然后将书本送至粉碎机。整个过程只需数分钟但处理的书籍往往需要数十年才能被重新发现。为什么是稀有书籍在AI行业训练大语言模型需要海量的文本数据。相比网络抓取从实体书中获得的内容更干净、更系统也避开了许多网站的反爬虫限制。稀有书籍通常具有独特的语言风格和历史信息对提升模型的语义理解有特殊价值。然而将这些书籍彻底销毁意味着人类永远失去了物理载体。这些书无法再被借阅、研究和传承。谷歌和互联网档案馆多年前就开始大规模扫描图书但通常会保留原始纸质版。亚马逊选择直接销毁一方面可能是为了降低成本另一方面也与其数字优先的战略有关。一位不愿透露姓名的前亚马逊工程师告诉Ars Technica“团队领导认为模型训练完成后原始书籍只是多余的库存。”版权与伦理的灰色地带这一做法在法律层面也极具争议。许多稀有书籍仍受版权保护亚马逊未经授权扫描并用于商业AI训练可能构成侵权。更重要的是销毁实体书籍等同销毁公共文化财富。图书馆和藏书家表示亚马逊的行为“比盗版更恶劣”。“你可以训练一个模型但你不应该烧掉’母本’。”一位图书史学者评论道。近年来AI公司因版权纠纷频繁被告从《纽约时报》诉OpenAI到作家群体集体诉讼科技公司对创作者版权的漠视已成为公愤。亚马逊作为科技巨头此举无疑将加剧这种矛盾。霸王龙标志的隐喻最令人震惊的是亚马逊这个团队竟然将自己的logo设计为一只张开血盆大口的霸王龙正准备一口吞下一本书。这个商标似乎是某种内部幽默但在外界的眼中它成了傲慢与破坏的象征。一位设计师讽刺道“他们知道自己正在吃掉书籍只是觉得这很有趣。”编者按AI的发展需要数据但数据的获取不能以牺牲人类文化遗产为代价。实体书不仅是信息的载体更是文明记忆的实体。即便数字扫描可以保存文本内容物理书籍本身的历史气息、装帧艺术与读者的情感联结都是无法被复制的。亚马逊作为一个以“地球上最大的书店”起家的公司理应成为知识的守护者而不是毁灭者。我们呼吁AI企业建立更负责任的训练数据政策在技术进步与人文遗产之间找到平衡。本文编译自Ars Technica本文首发于赢政天下https://www.winzheng.com获取更多深度技术内容与资源欢迎访问官网。
返回列表