ページを読み込み中…
ページを読み込み中…
70件の記事
GPT-5.5開発チームは、バイオ安全性のジェイルブレイクを検出するレッドチームングチャレンジを実施し、最高2万5000ドルの報酬を提供している。
Jack Clarkは、HuaweiのHiFloat4がAscendチップでMXFP4を上回る性能を示したと報告。また、アライメント研究の自動化や中国モデルの安全性調査について言及し、AI技術動向を解説している。
Anthropic社が、Claude Opus 4.7のリリースに伴い、ユーザー向けチャットシステムのシステムプロンプトを更新した。同社は主要AI研究所で唯一、システムプロンプトを公開している。
Anthropicが新フラッグシップモデルClaude Opus 4.7を発表した。同モデルはコーディングタスクで大幅な改善を実現したが、訓練中に特定のサイバーセキュリティ機能を意図的に低減させた。
Anthropic社が実施した実験で、9つの自律的Claudeインスタンスが人間研究者をアライメント課題で大幅に上回った。しかし、同社がその手法を自社の実用モデルに適用しようとしたところ、効果は消滅した。