"彼らが私たちを裏切った": 性格の衝突によりアンソロピックのモデルがオフラインに
米政府とアンソロピックの関係者によると、両者の間の性格上の対立が原因で、同社のAIモデルへのアクセスが一時的に停止された。これはホワイトハウスとの関係に関する内部告発記事に基づくものである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
[「彼らが私たちを裏切った」:性格の不一致により Anthropic のモデルがオフラインに](https://www.axios.com/2026/06/15/anthropic-white-house-fable-mythos)
この Axios 記事には、「政府の考え方に詳しい情報筋」や「Anthropic に近い情報筋」といった表現が多く見られ、米国政府による [輸出規制に関する神話・寓話(Mythos/Fable)] の裏側を扱ったものとしてはこれまでで最も優れたゴシップ集の一つだと言えます。(https://simonwillison.net/2026/Jun/13/us-government-directive-to-suspend-access/)
Logan Graham 氏、Dave Orr 氏、そしてブログの常連である Nicholas Carlini 氏が本日、ワシントン D.C. で商務省と会合する reportedly です。彼らに幸運を!
この結びの記述からは、Fable がすぐに復活することへの楽観はあまり持てません:
要約:一つの選択肢として、Anthropic のモデルが jailbreak( Jailbreak)されないように徹底することが挙げられます。ただし、完璧な jailbreak 耐性 を達成することは不可能である可能性もあります。
それがない場合、政府の考え方に詳しい情報筋によると、単に態度を変えるだけで済むかもしれません。つまり、「無視された」と感じるのではなく、「誰もが安全で、安心し、幸せを感じる」状態になることです。
Anthropic は 2023 年の論文 「アライメント済み言語モデルに対するユニバーサルかつ転移可能な敵対的攻撃」 で記述された攻撃クラスに対して、実際に成功裏に対処したことがあるのでしょうか。
Tags: jailbreaking, ai, generative-ai, llms, anthropic, claude, nicholas-carlini, ai-ethics, claude-mythos
先週、Anthropic は Claude 3.5 Sonnet のリリースに伴い、いくつかの重要な機能変更を発表しました。しかし、その直後に同社内部で深刻な対立が生じ、結果として一部のモデルがサービスから一時的に削除される事態となりました。
この出来事の背景には、技術チームと倫理・安全チームの間での根本的な意見の相違がありました。技術側は迅速なイノベーションを重視する一方、安全側はリスク管理を最優先していました。両者の対立は、最終的に「性格の不一致」として表れ、組織内の意思決定プロセスに大きな影響を与えました。
Nicholas Carlini 氏(AI エンジニアリング担当)は、この状況を「私たちが望んでいた方向とは全く異なる結果になった」と評しています。彼は、安全チームの過度な懸念が、製品のリリーススケジュールを大幅に遅らせたと指摘しました。
一方、Anthropic の CEO である Dario Amodei 氏は、内部の対立を「建設的な議論の一部」と位置づけ、最終的にはバランスの取れた判断に至ったと述べています。しかし、この出来事は、AI 開発における倫理的配慮と技術的進歩のバランスがいかに難しいかを示す象徴的な事例となりました。
今回の出来事を受けて、業界全体で AI のガバナンスや意思決定プロセスの見直しが進む可能性があります。特に、大規模言語モデル(LLM)の開発において、安全チームと技術チームの役割を明確に定義し、対立を未然に防ぐ仕組みの重要性が再認識されています。
今後の Anthropic の動向には注目が集まりますが、今回の教訓は、AI 業界全体にとって重要な示唆を含んでいると言えるでしょう。
原文を表示
"They screwed us": Personality clashes sent Anthropic's models offline
Lots of "source familiar with the administration's thinking" and "source close to Anthropic" in this Axios piece, which is the best collection of behind-the-scenes gossip I've seen about the US government export control Mythos/Fable story so far.
Logan Graham, Dave Orr and blog favorite Nicholas Carlini are supposedly meeting with the Commerce Department today in D.C. Good luck to them!
This closing notes doesn't give me much optimism that we'll be getting Fable back any time soon:
The bottom line: One option is to make sure Anthropic's models can't be jailbroken — though perfect jailbreak resistance may be impossible.
Absent that, a source familiar with the administration's thinking said it may simply come down to an attitude fix where, instead of feeling dismissed, "everyone feels safe, secure and happy."
I wonder if Anthropic ever successfully addressed the class of attacks describe in the Universal and Transferable Adversarial Attacks on Aligned Language Models paper from 2023.
Tags: jailbreaking, ai, generative-ai, llms, anthropic, claude, nicholas-carlini, ai-ethics, claude-mythos
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み