Anthropic が研究者の作業を阻害したと批判された方針を撤回
Anthropic は、競合モデルの訓練や AI コードのデバッグなどのタスクでClaude 5 の応答を拒否・劣化させる隠れた制限が研究者から批判され、同社の方針への透明性不足が問題視されたため、この方針を撤回し、安全対策を可視化する方針に転換した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Anthropic は、研究者たちからの反発を受けて、最先端大規模言語モデル(LLM)開発における安全対策を可視化することを決定しました。同社は以前、特定の行動の実行を求められた際、より能力の低いモデルへリクエストを静かに迂回させる措置をとっていました。研究者らは、Claude Fable 5 が競合するモデルのトレーニングや AI コードのデバッグ、ニューラルアーキテクチャの最適化といったタスクにおいて、応答を拒否したり劣化させたりしていることを発見しました。これにより、Anthropic の透明性の欠如に対する懸念が生じるとともに、期待通りの機能を持たないモデルに対してトークンと資金が費やされたことへの問題意識も高まりました。
原文を表示
Anthropic has decided to make its safeguards for frontier LLM development visible after backlash from researchers. The company had previously discreetly rerouted requests to a lesser model when asked to perform certain actions. Researchers found that Claude Fable 5 was either refusing or degrading responses for tasks like training competing models, debugging AI code, and optimizing neural architecture. This raised concerns about Anthropic's lack of transparency and also that tokens and money had been spent on a model that didn't do what was expected.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み