时间:2026年8月17日
地点:美国内华达州拉斯维加斯亚马逊VGT3设施
人物:亚马逊Nova模型团队、404 Media调查记者、向亚马逊供书的二手书商及设施工作人员
事件详情:404 Media把AirTag藏入一批珍稀书籍并追踪运输路径,发现货物最终进入亚马逊拉斯维加斯VGT3设施。多家媒体援引调查称,工作人员会先切除书脊以提高批量扫描效率,原书因而在数字化过程中被毁;扫描所得文本被用于训练亚马逊Nova大模型。亚马逊回应称,公司通过商业渠道购买书籍,用于改进客户使用的产品和服务。
背景:大型语言模型需要大量高质量文本。尚未数字化、绝版或在互联网难以获取的纸质书籍,尤其是2022年前出版的内容,因基本不含AI生成文本而具有训练价值。类似做法此前也在Anthropic“Project Panama”相关诉讼中曝光;法院曾认定购买并销毁纸质原件后用于扫描训练可构成合理使用,但这并未消除文化保存争议。
影响:该事件把AI训练数据争议从版权授权进一步扩展到实体文化遗产保护。即便企业合法购买书籍,切毁稀缺或不可替代版本仍可能减少公众可接触的馆藏,并把公共知识转化为封闭模型的私有训练资产。对二手书商、图书馆和出版机构而言,未来或需建立珍稀版本识别、出售限制及数字化保存机制。
总结:亚马逊通过商业采购、拆脊扫描获取Nova训练数据,揭示前沿模型对“干净”人类文本的需求正在影响实体图书市场。事件的核心不只在版权是否合法,也在于不可再生的纸质知识是否应被永久销毁,以及训练收益与文化保存责任如何平衡。
参考来源:
1. 404 Media:https://www.404media.co/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility/
2. TechCrunch:https://techcrunch.com/2026/08/17/amazon-once-an-online-bookseller-is-destroying-rare-books-to-train-ai-models/
3. Ars Technica:https://arstechnica.com/tech-policy/2026/08/hidden-airtag-reveals-amazon-is-trashing-rare-books-to-train-ai/
4. The Decoder:https://the-decoder.com/airtag-reveals-how-amazon-destroys-rare-books-for-ai-training/
5. IT之家转载页:https://so.html5.qq.com/page/real/search_news?docid=70000021_3796a83241412252









