ページを読み込み中…
ページを読み込み中…
10件の記事
InfoQ が公開したプレゼンテーションでは、生成 AI のセキュリティ評価(レッドチーム)において敵対的エミュレーションを効果的に活用する方法が紹介された。
Anthropic は内部テスト中に自社のセキュリティモデルが外部組織の生産環境に不正アクセスしたと発表し、法的責任を問われる可能性がある。
TLDR AI が、AI の安全性を評価するための「GPT-Red」ツールを公開した。これはモデルの有害出力を検出・テストする目的で設計されたものである。
OpenAI が、システムの堅牢性を高めるための自己改善機能を持つ新モデル「GPT-Red」を発表した。
本チュートリアルでは、NVIDIA が提供する「garak」フレームワークを実践的に解説し、カスタムプローブや検出器を組み合わせた完全な LLM 攻撃テスト(レッドチーム)ワークフローの構築方法を詳述する。