AI 企業搶購 2022 年前舊書訓練模型 大量實體書可能被有系統地銷毀 !?

Author:

Published:

- 廣告 -

生成式 AI 公司正面臨一個自己製造的問題:互聯網上充斥大量 AI 垃圾(俗稱「AI slop」),若繼續用這些合成文字訓練新模型,可能導致「模型崩潰」(model collapse),即模型表現一代不如一代。為解決這困境,部分 AI 實驗室開始大量購買 2022 年前印刷的實體舊書,作為「最後的乾淨訓練數據」,但這卻引發大量紙本書籍被銷毀的疑慮,原因來自 Anthropic 15 億美元版權和解案中法官的裁決。

為甚麼是 2022 年前的舊書?

數據經紀商 ISBNdb 在其網站上直言:「世界上最好的 AI 訓練數據,正放在書架上。」他們強調書籍是「密集、經過編輯、具權威性」的人類知識,結構遠勝於網路爬蟲抓取的內容。

關鍵在於出版年份。2022 年之前印刷的書籍,早於大型語言模型普及,理論上不可能包含 AI 生成文字。這正好避開兩大風險:

- 廣告 -
  • 模型崩潰:模型反覆訓練自己或同類 AI 的輸出,會令數據品質逐漸劣化。
  • 數據投毒:作者使用 Nightshade 等工具,可在文字中植入難以察覺的後門。Anthropic 的研究顯示,僅需 250 至 500 份被動過手腳的文件,就可能影響數萬億 token 的訓練集。而 2022 年前的書籍可完全避開這些問題。

ISBNdb 因此提供批量採購服務,並強調購買實體書能建立完整的「合法擁有證明」與保管鏈,方便法務團隊應對版權爭議。

訓練過程導致大量舊書被銷毀?

令人關注的是後舊書獲取數據的方法極具破壞性:為了方便高速掃描,批量採購回來的紙本書通常會用液壓裁切機切去書脊,再以高速掃描機處理,最後將紙張送去回收。ISBNdb 坦言,這種做法存在嚴重的「光學問題」(optics problem)。但一旦新聞中出現「AI 公司摧毀兩百萬本書」這類負面標題,肯定會引發關公公關災難,因此 ISBNdb 每一筆交易都簽訂嚴格保密協議(NDA),絕不披露顧客是誰。

其實這並非全新做法。Anthropic 早前的「Project Panama」計劃,就曾以類似方式處理約 200 萬本實體書。美國法院在相關訴訟中裁定,只要公司合法購買掃描內容用於訓練屬於合理使用(fair use),法官的判決理據之一是「複製行為會毀損每一份印刷原版,因此一份合法複製品不過是取代它罷了」。這正是 Anthropic 支付 15 億美元達成史上最大版權和解案後,法院確立的重要先例。

美國最大圖書分銷商 Ingram 已向出版商發出警告,並提供批量銷售的「退出選項」,顯示業界對這波採購潮的關注正在升溫。

解決訓練數據稀缺卻可能摧毀稀缺版本書籍

這股搶購潮反映 AI 訓練數據已進入「稀缺」階段。公開網路文本的可用量雖然龐大,但品質正快速下降。實體舊書成為少數仍能保證「純人類創作」的來源,尤其是已進入公有領域或版權風險較低的作品。

對二手書市場而言,影響已開始顯現。部分書商反映,從 2026 年 4 月起訂單量突然暴增,買家對價格極不敏感,且採購清單往往涵蓋冷門、專業性強的非小說類書籍,與一般收藏或轉售行為明顯不同。歐洲部分古書店甚至出現深夜大量訂單,引發對稀有版本被摧毀的擔憂。

- 廣告 -

從法律層面看,這條「購買—損毀—掃描」路徑,已被法院認可為可行方案,但長期而言仍可能引發文化與倫理爭議:AI 公司為追求乾淨數據,正在有系統地將紙本知識轉化為數碼資源後銷毀。

AI 產業正為自己造成的數據污染問題付出代價。當「一句從未被機器觸碰過的句子」變得稀缺時,書架上的舊書意外成為最有價值的資產。這波搶購潮也提醒業界:乾淨、可驗證的人類知識,正在快速變成稀缺資源。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -