AnthropicらLLMの暗号化推論トレースから推論を盗む手法が公開
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
研究者らが、AnthropicやOpenAIなどの専用大規模言語モデル(LLM)API から返される暗号化された思考連鎖ブロックを再生・解析することで、より強力なモデルの隠れた推論プロセスを平文で復元する手法を実証した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月13日 22:11
AI深層分析
キーポイント
暗号化された思考連鎖の復元可能性
研究者は、プロプライエタリ LLM がクライアントに返す暗号化された Chain-of-Thought ブロックを解析し、その中から推論プロセスを復元することに成功した。
弱いモデルを用いた間接攻撃手法
攻撃者は強力なモデルの出力を weaker な兄弟モデルに再生成させ、そのモデルをジャイルブレイクすることで、元のモデルの隠された推論を平文で抽出した。
機密情報の漏洩リスクの実証
復元された推論には API が報告する思考トークン数と一致する内容が含まれており、実際の秘密や機密情報が含まれていることが確認された。
重要な引用
Proprietary reasoning can be recovered from its encrypted traces.
Researchers took a trace produced by a frontier model, replayed it into a weaker sibling, jailbreaked the weaker model, and recovered the stronger model's hidden reasoning in plaintext.
編集コメントを表示
編集コメント
この研究は、API を通じて提供される推論プロセスの機密性が、暗号化だけでは守れないことを示唆しており、LLM のセキュリティ設計において新たな課題を提起している。企業は API の利用規約や技術的制限を見直す必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
暗号化された推論の痕跡から、独自モデルの推論プロセスを復元できる。Anthropic、OpenAI、Google は、クライアントに対して暗号化された思考連鎖(chain-of-thought)ブロックを返しており、これはセッションやユーザー、モデルを超えて再生可能だ。
研究者たちは、最先端モデルが生成した痕跡を取得し、それをより弱い兄弟モデルに再生。その弱いモデルを脱獄(jailbreak)することで、最先端モデルの隠された推論を平文で復元することに成功した。この手法では、最先端モデル自体を直接攻撃したり、そのディストillation防止機構をトリガーしたりする必要はなかった。
復号化された推論内容は、API が報告する「思考トークン」の数と密接に対応しており、そこには実際の秘密や機密情報が含まれていることが確認されている。
原文を表示
Proprietary reasoning can be recovered from its encrypted traces. Anthropic, OpenAI, and Google return encrypted chain-of-thought blocks to clients that can be replayed across sessions, users, and models. Researchers took a trace produced by a frontier model, replayed it into a weaker sibling, jailbreaked the weaker model, and recovered the stronger model's hidden reasoning in plaintext, without ever attacking the stronger model directly or triggering its anti-distillation safeguards. The decoded reasoning closely tracks the number of hidden thinking tokens reported by the API, and they contain real secrets and sensitive information.
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み