蘋果AirTag追蹤1,000本珍稀書,直擊亞馬遜LAS8倉庫「拆書餵AI」殘酷現場

一枚硬幣大小的蘋果AirTag,揭開了亞馬遜位在內華達州沙漠深處的秘密。它藏在一本珍稀書籍的夾層裡,跟著1,000本實體藏書,從加州出發,途經密爾瓦基、科羅拉多州大章克申,最後訊號停在一個代號「LAS8」的亞馬遜物流倉庫——那裡不是用來存貨,而是用來「銷毀」。

直擊「VGT3」管制區:書脊被切斷,文字成AI飼料

這項調查由外媒《404 Media》與珍稀書籍賣家聯手執行,團隊在一筆上千本珍貴藏書的採購訂單中,將AirTag植入書本夾層,展開數週的跨州追蹤。最終定位的「LAS8」倉庫,公開業務是亞馬遜的按需印刷(Print-on-Demand)服務,但內部一個標記為「VGT3」的管制區域,運作的卻是完全相反的破壞性作業線。

根據調查揭露的現場流程,工作人員用專業切紙設備切斷書脊(Debinding),將裝訂完整的書籍解體為零散紙頁,接著送入工業級高速進紙掃描儀進行全自動光學掃描,文字在極短時間內被轉化為純文字數據。整個過程沒有保留數位複本給公眾借閱,也沒有轉為PDF或電子書——這些文字的唯一去處,是直接灌注到大語言模型的底層數據集,作為預訓練演算法的「飼料」。一旦文字被榨乾,紙張碎片與封皮就當成廢棄物直接丟棄。

為什麼要「毀書取字」?AI的資料荒與模型崩潰危機

科技巨頭之所以用這麼極端的手段搶書,核心原因很現實:網路上的文字已經被AI生成內容大量污染,開發商面臨嚴重的「資料荒」。

專家反覆警告,當大型語言模型反覆使用AI生成的合成資料訓練,會引發「模型崩潰(Model Collapse)」——模型輸出的內容變得同質化、平庸化,甚至喪失邏輯推理能力。同時,合成資料會放大AI的「幻覺(Hallucination)」問題,讓錯誤資訊在遞迴訓練中被強化為虛假的基準。為了突破這個瓶頸、通過更嚴苛的評測,開發商急需「未被AI污染過」的人類原創內容。尚未數位化的古老實體書籍,因為保留了純粹的人類智慧,成了科技公司眼中最頂級的「未污染黃金礦脈」。

合法,但文化界拉警報

從法律層面來看,目前法院判例傾向於認定這類操作屬於「合理使用(Fair Use)」範疇,前提是科技公司沒有將數位化副本公開發行或轉售,僅作為內部訓練參數分析。事實上,不只亞馬遜,包括知名AI獨角獸Anthropic在內的多數商業AI研發機構,都已加入搶購實體書籍的行列。

但法律的許可,擋不住文化界的巨大焦慮。文史學者沉痛指出,實體書籍存量有限,許多絕版書與地方文獻的存世量本來就稀少,在這場「先拆書、後銷毀」的AI軍備競賽中,部分人類文化遺產可能就此在物理世界中徹底絕跡——它們的內容雖然活在AI的參數裡,但再也沒有任何人能觸摸到那本書的紙張、摺痕與印刷油墨的氣味。

編輯觀點:這則調查最讓人在意的,不是AI需要數據——這早就不是新聞。真正刺眼的是「拆完就丟」的態度,連數位化典藏都省了。當我們把珍稀書籍視為純粹的「原料」,而不是需要傳承的文化載體,那AI就算學會了所有人類知識,也學不會人類為什麼要珍惜一本書。話說回來,如果連古騰堡聖經或台灣日治時期的地方寫真帖都能被當成數據飼料,那我們保存實體文化的機制,顯然出了很大的漏洞。

後續觀察:這場資源爭奪戰只會更激烈

隨著AI模型持續往更高階的推理能力邁進,對「原始、未污染」人類文字的需求只會更大。目前沒有跡象顯示亞馬遜或任何科技巨頭會放緩這條供應鏈的運作,反而可能加速布局更多類似「VGT3」的管制區域。文化機構與政府是否會介入監管,或建立例外條款來保護特定等級的珍稀藏書,將是接下來值得緊盯的焦點。這件事沒有簡單的對錯,但至少我們現在知道,那些被我們視為文化瑰寶的舊書,在AI時代有了全新的——而且可能是最後一次——命運。

你的書架,可能就是AI的下一座礦場。如果你手上保有絕版書、地方文獻或家族流傳的老書,它的價值可能遠超你目前的想像——不論是作為文化資產,或是作為AI時代最後一批「未污染」的文字。不妨開始盤點身邊的實體藏書,思考它們的數位化與保存方式,因為在不久的將來,這些紙頁可能不只是回憶,而是人類與AI之間,最後一道真實的邊界。

本文改寫整理自公開新聞來源,原始報導由T客邦發布。

常見問題 FAQ

亞馬遜為什麼要買實體書來拆掉,而不是直接用數位版訓練AI?

因為目前仍有大量珍稀書籍從未被數位化,且實體書內容未受AI生成文字污染,是訓練高階語言模型最珍貴的「原始資料」。

這種拆書掃描的行為在美國合法嗎?

目前美國法院判例傾向認定此類操作屬於「合理使用」範圍,前提是數位化內容僅供內部訓練使用,未公開販售或發行。

一般讀者手上的舊書也可能被AI公司收購嗎?

目前主要鎖定絕版書、地方文獻與稀有藏書,但隨著AI資料荒加劇,收購範圍可能持續擴大,有特殊價值的實體書籍市場行情正在升溫。

「模型崩潰」是什麼意思?

指AI反覆用AI生成的內容訓練自己,導致輸出越來越單調、邏輯越差、錯誤越放大的惡性循環,是當前AI研發最頭痛的問題之一。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。