Amazon、AI学習用に希少書を切断・スキャン
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
5媒体で確認
404 Media · The Decoder · Simon Willison Blog · TechCrunch AI · Ars Technica AI
各社の報じ方を比較 ↓Amazon は AI 学習用として希少書籍を大量に購入し、背表紙を切断してスキャンする行為を行っていることが 404 Media の追跡調査で確認された。
AI深層分析を開く2026年8月18日 03:03
AI深層分析
キーポイント
希少書籍の物理的破壊とデータ収集
Amazon は AI 学習用として希少書籍を大量に購入し、背表紙を切断してスキャンする行為を行っていることが 404 Media の追跡調査で確認された。
学習施設 VGT3 と企業の主張
ネバダ州ラスベガスにある施設「VGT3」がその処理拠点であり、Amazon は同社によると顧客サービスの向上のために商業チャネルを通じて書籍を購入していると発表している。
モデル崩壊防止のためのデータ戦略
インターネット上に存在しない 2022 年以前のテキストは AI 生成物ではないため、LLM が生成したテキストのみで学習して品質が低下する「モデル崩壊」を防ぐために貴重なデータ源となっている。
重要な引用
Amazon is buying tons of rare books, cutting off their spines, and scanning them for AI training
purchases books through commercial channels to improve the products and services customers use
When LLMs train on AI-generated text, they risk 'model collapse'
編集コメントを表示
編集コメント
AI モデルの学習データ確保のために文化財を物理的に破壊する行為は、技術的必要性と文化的保存の観点から大きな議論を呼ぶ。企業側が商業チャネルからの購入を主張している点も、今後の法的な争点となり得る重要な要素である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Amazon はかつてオンライン書店でしたが、現在は AI モデルの学習のために希少書を破壊しています。404 Media の報道によると、同社は大量の希少書を購入し、背表紙を切断してスキャンし、AI 学習に利用しているそうです。この調査では、ある希少書に追跡装置を設置したところ、その本がラスベガスにある Amazon の施設に到着することが確認されました。
この施設は「VGT3」と呼ばれ、恐竜が本を爪で掴んでいるシンボルマークで知られています。Amazon は 404 Media に対して、「顧客が利用する製品やサービスの向上のために、商業チャネルを通じて書籍を購入している」という声明を発表しています。
Amazon などの企業は、大規模言語モデル(LLM)の学習に想像を絶するほどの大量のテキストデータを必要としています。すでにインターネット上の情報はほぼすべて取り込まれており、Anthropic の場合は違法な 海賊版 書籍まで摂取しています。そのため、絶版やインターネット上で入手不可能な希少書は、貴重な学習データ源として注目されています。
これらのテキストが特に価値があるのは、2022 年以前に出版されたものが LLM によって生成された可能性がゼロだからです。LLM が AI 生成のテキストで学習すると、「モデル崩壊」というリスクに直面します。これは、AI 生成のテキストを過剰に摂取した結果、LLM の出力品質が低下する現象です。
原文を表示
Amazon is buying tons of rare books, cutting off their spines, and scanning them for AI training, according to 404 Media, which placed a tracking device in a rare book that ultimately arrived at an Amazon facility in Las Vegas.
The facility, known as VGT3, identifies itself with a symbol of a dinosaur holding a book in its claws. Amazon told 404 Media in a statement that it “purchases books through commercial channels to improve the products and services customers use.”
Companies like Amazon need unfathomably large amounts of text to train their LLMs, which have already ingested what they can from the internet (and, in Anthropic’s case, illegally pirated books). Rare books, especially ones that are out of print or impossible to find on the internet, offer a new source of coveted training data.
These texts are especially valuable since there’s no chance that anything published before 2022 was written by an LLM. When LLMs train on AI-generated text, they risk “model collapse,” which can occur when the quality of an LLM’s outputs degrade after ingesting too much AI-generated text.
同じ出来事を5媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み