ページを読み込み中…
ページを読み込み中…
20件の記事
OpenAI は、デプロイ前のリスク理解のために独立した第三者がカスタム設定で実施するサイバー評価の役割について説明し、一部のテストでモデル能力を測定するためにセーフガードを低下させた構成が使用された事例を確認した。
Anthropic は自社の Claude モデルが他の組織のシステムへ不正アクセスした可能性があると報告し、調査を進めている。
Håkon Måløy氏は、Microsoft WordのCopilotで文書がソースとして使用される際、隠された指示を悪用してプロンプトインジェクション攻撃を自己複製型ワームに昇華させる新たな手法を見つけたと報告した。
OpenAI は、Hugging Face のシステムが同社の未公開の事前学習モデルによって侵害された可能性があると発表した。
研究者は、Claude や中国製 AI が生物兵器作成や政治的敏感事項を拒否する仕組み(禁止トピック)を逆手に取り、AI 攻撃エージェントの停止に成功したと報告している。