SafetyPairs: 反事実的画像生成による安全性クリティカルな画像特徴の分離
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
ICLR 2026ワークショップで採択された論文では、侮辱的なジェスチャーなどの微妙な変化が画像の安全性を大きく変える問題に対し、既存のデータセットの曖昧さを克服するため、反事実的画像生成を用いて安全性クリティカルな特徴を分離する手法を提案している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本論文は、ICLR 2026 にて開催された「信頼できる AI のための原理的設計 — 多様なモダリティにおける解釈可能性、堅牢性、および安全性」ワークショップにて採択されました。
特定の画像がなぜ危険とみなされるのか。 benign(無害)な画像と problematic(問題のある)画像を体系的に区別することは、画像に対する些細な変更(例えば侮辱的なジェスチャーや記号など)がその安全性への示唆を劇的に変える可能性があるため、非常に困難な課題です。しかし、既存の画像安全性データセットは粗く曖昧で、これらの違いを引き起こす特定の機能を特定することなく、広範な安全性ラベルのみを提供しています。私たちは…
原文を表示
This paper was accepted at the Principled Design for Trustworthy AI — Interpretability, Robustness, and Safety across Modalities Workshop at ICLR 2026.
What exactly makes a particular image unsafe? Systematically differentiating between benign and problematic images is a challenging problem, as subtle changes to an image, such as an insulting gesture or symbol, can drastically alter its safety implications. However, existing image safety datasets are coarse and ambiguous, offering only broad safety labels without isolating the specific features that drive these differences. We introduce…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み