尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

你卖的旧书,可能正被亚马逊买走、切碎、喂给 AI

你卖的旧书,可能正被亚马逊买走、切碎、喂给 AI 记者在一本珍本书里放了追踪器一路跟到拉斯维加斯——那里有家亚马逊仓库员工每天的工作就是收书、切掉书脊、扫描、然后把这些书毁掉。8 月 17 日科技调查媒体 404 Media 干了一件很「侦探小说」的事他们怀疑有 AI 公司在大批收购实体书拿去训练模型于是往一批珍本书的包裹里塞了个追踪器然后一路看着它在美国境内转运——最后停在了拉斯维加斯一个亚马逊仓库。这个仓库代号 VGT3。在这里工作的亚马逊员工说他们每天的工作只有一件事接收成卡车的实体书把书脊整个切掉送进机器高速扫描书在过程中被直接销毁。这个团队的 Logo 是一只手里抓着书的恐龙龇着牙。一边是 AI 生成的书正在淹没亚马逊货架一边是亚马逊在另一个仓库里大批切碎人类写的书。这两件事发生在同一家公司身上这件事比任何「AI 会不会取代作家」的讨论都更真实。大家以为的 vs 实际发生的多数人对「AI 训练数据」的想象是这样的工程师写个爬虫从网上抓文本轻飘飘没有实体代价。实际发生的是AI 公司对实体书的需求大到值得建一条「买书—运书—切书—扫描—销毁」的实体流水线。因为书里有的东西互联网上没有。一篇 8 月 15 日发布的学术研究分析 1.4 万本亚马逊自出版电子书给出了原因研究者用工具追踪后发现卖得最好的 AI 生成书有45% 的文本由「只出现在极少数出版书籍里、整个互联网上都搜不到」的罕见表达构成。而获奖文学作品的这个比例只有 19.1%。翻译成人话模型最馋的恰恰是那些只存在于纸书里的语言。网上的数据已经不够了AI 正在回头吃实体世界。互联网被吃完了现在轮到书架了。背后到底发生了什么把这次调查和近期研究拼起来链条很清楚第一步收购。404 Media 发现亚马逊在大批量采购书籍重点是市场上流通量小、图书馆和档案馆都未必齐的品类——因为常见的书早就被扫过了稀缺的才是有价值的。第二步转运。那本带追踪器的珍本书横穿了半个美国中间经过多次转手来源已经难以追溯。第三步扫描销毁。终点是拉斯维加斯的 VGT3 仓库切书脊、机器扫描、纸浆处理。员工透露这里是「只进不出」——书进来数据出去。为什么非要毁掉因为拆掉书脊、把内页摊平机器扫描速度最快。一本一本翻着扫效率差一个数量级。对流水线来说书脊是障碍对文化来说书脊是书成为书的全部。这个反常识为什么成立你可能有三连问一个个拆。问电子版不是已经有了吗何必买纸书大量书根本没有电子版——尤其是绝版书、小印量书、地方文献。出版社没动力数字化卖不动的库存但对 AI 公司来说这些是高质量语料的最后矿脉。问不是有版权争议吗正是。Kadrey 诉 Meta 案里法官已经警告拿版权书训练一个年入数十亿美元、还会生成海量竞争性作品的产品「很难想象」这算合理使用。这次曝光的实体销毁作业会让 AI 公司在所有未决版权案里的处境更被动——你不但用了我的书你还把它碎了。问普通人卖旧书跟这事有关系吗有。404 Media 的调查方式恰恰说明旧书市场里收购方是谁、书去了哪卖家完全看不见。你在二手平台点「出售」的那一刻并不知道对面是爱书人还是一条切碎机的传送带。对我们意味着什么对写作者这是个双重挤压。前面那篇研究的核心发现是「摊薄」——书目总量 3 年涨了 38 倍季度收入只涨 8.9 倍即使完全没检测出 AI 文本的纯人类作品单书收入也在 8 个品类中的 7 个里下跌。你的书写得再干净池子里的水也在被稀释。对藏书人和卖书人留个心眼。真有感情的书别当废纸批量出优先给认识的书友、独立书店或图书馆捐赠大额收购、出价反常爽快、不看品相只问「都有什么书」的买家多问一句用途并不失礼。对普通读者这事离你不远。它意味着 AI 的数据饥荒已经从「抓网页」升级到「吃实体资产」下一个可能是老照片、录音带、档案。你家里那些没数字化的东西正在变得比你想的值钱。数据是新石油这个比喻已经过时了更准确的说法是数据是新矿山而矿下面埋着的是我们已有的文化。
返回列表