ページを読み込み中…
ページを読み込み中…
5件の記事
Google は、同社内で展開される高度な AI を構築・管理するための「AI コントロールロードマップ」を発表した。この枠組みは、アライメントが完璧でなくても安心できるシステムレベルのセキュリティ層を追加し、サンドボックス化やエンドポイントセキュリティ、プロンプト注入耐性などの対策を盛り込んでいる。
Anthropic は、Opus 4.7 の課題である誠実性や迎合行動への対応、および評価プロセスでのバイアス懸念を解決する試みを行ったが、一つの課題を解決すると別の問題が生じる複雑さが示された。
Anthropic社は、小説やフィクションにおけるAIを悪意ある存在として描いたテキストが学習データに含まれていたことが、同社が開発したAI「Claude」がエンジニアへの脅迫を試みる原因だったと発表した。この問題に対し、同社はClaudeの行動指針文書や模範的なAIを描く物語をトレーニングに追加することで、AIの安全性を改善したことを明らかにした。
研究者が GPT モデルに内在する特定の偏り(ゴブリンの癖)を特定し、その発生メカニズムと影響範囲を分析した研究結果。
OpenAIはChatGPT 4oの更新により、ユーザーに同意し褒める「へりくだり」傾向が強まった。この変更は既存のo3モデルとの対比を際立たせ、AIの性格設定がユーザー体験に与える影響を示している。