Anthropic、Claude Fable 5.1 のウォーターマークに開発者が無視できない盲点を指摘
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The New Stack AI
Anthropic は生成テキストに統計的シグネチャを埋め込む「Claude Fable 5.1」を発表したが、コード生成における不確実性の低さが同システムの検出限界となり、開発者はその盲点を認識する必要がある。
AI深層分析を開く2026年9月2日 06:35
AI深層分析
キーポイント
コード生成におけるウォーターマークの限界
コードは変数や演算子の選択が厳密に制約されるため、統計的パターンを形成しにくく、正確性を保つためにウォーターマークが適用されない場合がある。
思考ブロック(Thinking Blocks)の制限強化
新 API アカウントにおいて、会話履歴に「思考」ブロックを引き継ぐ行為を制限し、大規模なモデル蒸留を防ぐ措置が講じられた。
EU コード署名に基づく世界的展開
AI 生成コンテンツの透明性に関する EU コード実践に署名した同社は、地域による制限が困難であるため、全世界でこの技術を適用し、既存モデルにも順次導入する。
テキストベースの検出技術の仕組み
Google DeepMind の SynthID-Text に基づき、確率そのものを変更せず選択のランダム性を操作することで、長文応答に統計的パターンを埋め込む。
推論ブロックの改ざん防止と API 制限
Fable 5.1 では、保存された推論ブロックを生成時のコンテキストに紐付けることで、会話途中での推論ブロックの暗号解除や他モデルへの転用を防ぐ。この制限は 8 月 31 日以降に作成された新しいアカウントから適用される。
重要な引用
Code is one place where the limits of Anthropic's watermarking system become obvious.
Anthropic therefore doesn't apply the watermark when a particular token is required for accuracy.
The technology is based on Google DeepMind's SynthID-Text.
If choosing a different token could make an answer incorrect or break the code, Anthropic doesn't apply the watermark.
編集コメントを表示
編集コメント
生成モデルの出力に痕跡を残す技術は、AI の信頼性確保において重要な役割を果たすが、その適用範囲には明確な限界が存在する。開発者はこの「盲点」を認識し、ウォーターマークの有無だけで生成物の真偽を判断しないよう注意が必要である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

Anthropic は火曜日に Claude Fable 5.1 を発表し、生成されたテキストに統計的なシグネチャを組み込みました。しかし、開発者はこのシグネチャがモデルが生み出すすべての出力で均等に強く現れるわけではないことを理解しておく必要があります。
コードの領域では、Anthropic の透かしシステムの限界がはっきりと浮き彫りになります。メタデータや隠し文字を追加するのではなく、このシステムは Claude が次のトークンを選択する際のランダム性を変更します。Anthropic によれば、これにより出力の品質や内容に影響はないといいます。
十分に長い応答において、これらのトークン選択は統計的なパターンを形成し、Claude がテキストの作成や処理に関与した可能性を示す証拠となります。これはモデルが同じ意味を表現する複数の方法を持つ自然言語では効果的ですが、変数、演算子、関数の選択一つでプログラムの動作が変わったり、壊れたりする可能性があるコードでは機能しません。そのため Anthropic は、正確性を保つために特定のトークンが必要な場合には透かしを適用しません。
開発者はまた、Claude が「思考の保持(preserved thinking)」を扱う方法の変化にも対応する必要があります。Fable 5.1 では、Anthropic は新しい API アカウントが、その思考ブロックを修正された会話に引き継ぐタイミングを制限しています。この手法は同社がモデルを大規模に蒸留する際にも使用されているといいます。
十分に長い応答において、トークンの選択は統計的なパターンを形成します。このパターンは、テキストの作成や処理に Claude が関与した可能性を示す証拠となります。
ウォーターマークの仕組み
Anthropic は 8 月 14 日、AI 生成コンテンツの透明性に関する EU コード・オブ・プラクティスに署名し、約 190 の他の署名者の一人となったことに伴い、これらの要件を満たす計画の詳細を公表しました。同社は地域ごとに制限する確実な方法がないため、このウォーターマークを全世界で適用しています。また、今後数ヶ月かけて既存の Claude モデルにも順次導入される予定です。
この技術は Google DeepMind の SynthID-Text に基づいています。Claude が次のトークンに割り当てる確率そのものを変えるのではなく、選択肢の中からランダムに選ぶ過程における不確実性を変化させます。十分に長い応答において、これらの選択が統計的なパターンとして残され、適切な鍵を用いれば後から検出可能になります。
ウォーターマークはメタデータとして付随するものではなく、テキストそのものに組み込まれているため、単に別の場所にコピーしても消去されることはありません。
Anthropic によると、このウォーターマークは一定の編集にも耐えることができます。ただし、テキストを十分に書き換えてしまうと、最終的には信号は失われます。
Code's low-entropy problem
コード生成におけるウォーターマーキングの限界は、特に顕著に現れます。もしトークンの選択が回答の正解性を損なったり、コードを破綻させたりする可能性がある場合、Anthropic はその部分にはウォーターマークを適用しません。そのため、ウォーターマークはコメントなどの制約が少ない出力領域に残ることがありますが、短いレスポンスでは検出に必要な信号量が不足し、信頼性のある検出が困難になるケースもあります。
Anthropic は現在、この検出機能を API を通じてプライベートプレビューとして提供し始めています。現時点でのアクセス権限は、規制当局や法執行機関、メディア組織、ファクトチェッカー、研究者、および自社の AI 法(AI Act)コンプライアンス対応が必要な企業など、対象となるグループに限定されています。Anthropic は今後はこの API をより広く一般公開する計画です。
推論ブロックとモデルの蒸留に関する変更
Fable 5.1 では、モデルの蒸留(distillation)対策として新たな変更が加えられています。Claude の Messages API では、開発者が後続のターンで再入力できるよう暗号化された推論ブロックを返すことが可能です。これにより、モデルは会話を通じて推論を継続できます。
Anthropic によると、会話の初期部分を改変しつつこれらのブロックを保持すると、Claude がその推論プロセスを復号化して表示してしまうリスクがあります。そうなれば、その推論内容が別のモデルの学習データとして悪用される恐れがあります。
Fable 5.1 では、この経路を塞ぐため、保存された推論ブロックを生成時のコンテキストに紐付ける仕組みを導入しました。この制限は、Claude Platform、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Azure Foundry において、8 月 31 日以降に作成された新規アカウントに適用されます。
既存のアカウントは、当面はこの制限の影響を受けずに Fable 5.1 を使い続けることができますが、Anthropic は今後のモデルリリースではすべてのユーザーにこの制限を適用する方針です。
エージェントハッチス(harnesses)におけるトレードオフ
独自のエージェントハッチスを構築する開発者にとって、この制限は目に見えにくい問題を引き起こします。エージェントシステムは、モデル呼び出しのたびにコンテキストを固定したままにするわけではありません。ハッチスは古いやり取りを削除したり、過去の履歴を要約したり、タスク遂行中に会話を再構成したりすることがあります。これらはコンテキスト管理の一般的な手法ですが、同時に「思考ブロック(thinking block)」に紐づくコンテキストも変化させてしまいます。
Anthropic は、開発者に対して思考ブロックを変更せず、以前のシステムプロンプト、ツール定義、メッセージをバイト単位で完全にそのまま保持するよう求めています。このコンテキストを変更するアプリケーションでは、同じ思考ブロックを引き継ぐのではなく、Claude の推論状態の管理方法を改める必要があります。
カスタム統合を行っている顧客はごく一部と予想されており、既存の Fable 5.1 API ユーザーには、今後のモデルでこの制限が標準になる前に変更を加えるための猶予期間が与えられています。
これら 2 つの変更は異なる課題に対応するものですが、Claude を活用して構築する際の開発者の柔軟性を完全に制限することなく、双方とも保護機能を追加したものです。
Claude Fable 5.1 の透かし:開発者が無視できない盲点がある
この投稿は、The New Stack に最初に掲載されました。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み