生成 AI の違法コンテンツから子供を守る新手法が開発される
本文の状態
日本語全文を表示中
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MIT ML News
MIT の研究チームは、生成モデルが違法な児童性的虐待画像(CSAM)を生成する能力を持つかどうかを、実際に出力を生成することなく内部表現を検査する新しい監査手法を開発し、100%の精度で有害なモデルを検出することに成功した。
AI深層分析を開く2026年8月1日 13:02
AI深層分析
キーポイント
非生成型によるCSAM検出手法の開発
MIT の研究チームは、違法コンテンツを直接生成するリスクを回避するため、モデルが CSAM を生成できるかどうかを検出するために内部表現(隠れた表現)を分析する新しい監査アプローチを開発した。
100%の精度で有害なモデル変種を特定
この手法を実験的にテストした結果、CSAM 生成に特化されたモデルの変種を 100 パーセントの精度で識別することが可能であり、既存の盲点を解消する成果となった。
プラットフォームと法執行機関への応用
この技術はオープンソースモデルをホストするプラットフォームが不安全なモデルを即座にフラグ付けして削除したり、アップロードを防ぐために利用でき、法執行機関によるテスト手段としても機能する。
MIT と Thorn の連携による研究発表
MIT の研究者らが児童保護非営利団体「Thorn」と協力して開発したこの手法は、「Trustworthy AI for Good」ワークショップで注目講演として発表される予定である。
LoRA適応子の非生成型監査手法
研究者はモデルの出力ではなく、ファインチューニング時に適用されるLoRA適応子の変化を調べることで有害な能力の有無を検出する手法を開発した。この手法ではランダムデータを入力して内部構造の操作を分析し、画像生成を行わずに有害性を判定できる。
重要な引用
"This unlocks a new avenue for platforms that host open-source models and for law enforcement to actually test whether a model is capable of generating CSAM. Before, we had no way of measuring this. It was a huge blind spot that some people were taking advantage of."
"Their technique examines how the inner workings of a model have been adapted, but it never generates an output. By examining hidden representations, it can reliably infer whether a model has been specialized to produce harmful imagery."
"We are in this very difficult situation where, based on the law itself, we cannot use the de facto means of evaluation. We had to throw out the entire toolkit and take a different approach," Suriyakumar says.
"There is a huge bucket of child safety concerns with AI, and these are real concerns that need to be addressed. A lot of children are being harmed by AI deepfakes."
編集コメントを表示
編集コメント
生成 AI の悪用が深刻化する中、有害コンテンツを直接生成することなく安全性を検証する技術は、業界全体の信頼性向上に寄与する重要な一歩である。特に児童保護の観点から、プラットフォーム運営者によるモデル管理の基準となる可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
生成AIの爆発的な普及に伴い、特定の芸術様式で製品レンダリングを生成するなど、誰でも自分のタスクに合わせて調整できるオープンソースモデルが多数オンライン上で利用可能になっています。
しかし、これらのモデルは悪意のある人物の手にも渡り、ヘイトスピーチや児童性的虐待素材(CSAM)といった違法コンテンツの生成に最適化されてしまう恐れがあります。これは深刻な問題であり、米国失踪・搾取児童センターによると、2025年に報告されたAI生成のCSAM件数は150万件を超え、前年の6万7,000件から急増しています。
エンジニアたちは通常、モデルにプロンプトを入力して出力を検証することで、有害な能力がないかテストします。しかし、CSAMの場合、意図の有無にかかわらず米国で生成自体が違法であるため、この手法は使えません。
こうしたジレンマを回避し、AIの安全性を高めるために、MITの大学院生ヴィニト・スリヤクマー氏とアシア・ウィルソン准教授、マルジーエ・ガスセミ准教授率いる研究チームが、児童保護団体「Thorn」の研究者らと協力し、モデルにプロンプトを与えずともCSAMを生成できるかどうかを検証する新たな監査手法を開発しました。Thornは、デジタル時代における児童の性的虐待や搾取からの保護方法を根本から変えることを使命とする非営利団体です。
この手法は、モデルの内部動作がどのように改変されたかを検証するものであり、自ら出力を生成することはありません。隠れた表現(hidden representations)を分析することで、そのモデルが悪意のある画像を生成するために特化されているかどうかを、高い精度で推測することが可能です。
テストでは、児童性的虐待素材(CSAM)の生成に特化されたモデル変種を、100% の精度で検出することに成功しました。ホスティングプラットフォームはこの技術を活用して、安全でないモデルを特定し、迅速に削除したり、最初からアップロードされないように防止したりすることが可能になります。
「この手法は、オープンソースのモデルをホストするプラットフォームや法執行機関にとって、モデルが CSAM を生成できる能力を持っているかどうかを実際に検証できる新たな道を開くものです。以前はこの能力を測定する方法がありませんでした。これは悪意のある人々が利用していた大きな盲点でした。今では、深刻な悪影響を及ぼしている AI セーフティの問題に対処できるようになりました」と、この手法に関する論文の筆頭著者であり、MIT電気工学・コンピュータサイエンス専攻(EECS)の大学院生であるヴィニト・スリヤクマール氏は語っています。
論文の共著者には、Suriyakamur氏とWilson氏(EECSのリスト・バース・キャリア開発教授、および情報意思決定システム研究所 LIDS の主任研究員)に加え、MIT のポスドクである Lena Stempfle 氏、EECS の准教授で医療工学科学研究所 IMES と LIDS に所属する Ghassemi 氏、そしてボストン大学や Thorn 社の研究者らが名を連ねています。本論文は、国際機械学習学会(ICML)で開催される「Trustworthy AI for Good」ワークショップの注目発表(スポットライト)として取り上げられます。
適応性の監査
近年の技術により、ユーザーは「ファインチューニング」と呼ばれるプロセスを通じて、生成 AI モデルを自らのタスクに特化させることが容易になりました。
モデル全体をタスク固有のデータセットで再学習するのではなく、「低ランク適応(LoRA)」と呼ばれるアルゴリズムを利用することで、より効率的な方法でモデルを特化させることが可能になります。
これにより、芸術運動を模倣した水彩画の生成など、多様な目的に応じた新しい生成 AI モデルの派生版が次々と登場しました。しかし同時に、悪意のある行為者が高品質な児童性的虐待画像(CSAM)やその他の有害な画像を生成するモデルを作成することも可能にしてしまいました。
モデルの監査では通常、エンジニアが有害なコンテンツを要求して出力を確認しますが、この手作業による監査プロセスはスケーラブルではありません。さらに、悪質ないわゆる「ヘイナス」な画像を繰り返し生成させることは、人間評価者に対して心理的な悪影響を及ぼす恐れがあります。
この評価手法は、米国や多くの国際法域においていかなる目的でも生成が違法である児童性的虐待物(CSAM)のテストにおいては、すぐに機能しなくなります。
「法律そのものに基づけば、事実上の評価手段を使うことができないという非常に困難な状況にあります。そのため、既存のツールキットをすべて捨てて、異なるアプローチを取る必要がありました」とスリヤクマール氏は語ります。
このジレンマを知った研究者たちは、この問題に対処するために非営利団体「Thorn」と連携しました。
生成に頼らない解決策
出力そのものに焦点を当てるのではなく、研究者たちは LoRA アルゴリズムがファインチューニング(微調整)の過程で行う変更点に着目しました。
この手法では、LoRA アダプターと呼ばれるこれらの変更点を調査し、モデルが有害な機能に特化していないかどうかを、画像などを生成することなく判定します。
「ガウス・プロービング」と呼ばれる技術を用いて、研究者たちはランダムなデータポイントをモデルに入力し、そのデータがモデルの多層構造内でどのように処理されるかを分析します。
「モデルを最後まで実行したり、プロンプトを入力して画像を生成することは決してありません」とスリヤクマール氏は説明しています。
研究者たちは、モデル内部の複数の時点におけるこれらの変更点を捕捉し、平均化することで LoRA アダプターがどのように計算を変容させたかを要約しました。その結果、この反応こそが、モデルがいかにして有害な機能に特化させられたかを示す強力なシグナルであることが判明したのです。
研究チームは、この手法を3種類のモデル変種に対してテストし、CSAM(児童性的虐待画像)や有害な画像、あるいは安全なコンテンツを生成するよう調整されたLoRAアダプターから得た正解データと比較しました。
その結果、CSAM生成用に調整されたモデルを特定する精度は100%でした。
「AIにおける児童保護の懸念は非常に大きく、これらは真摯に取り組むべき現実的な問題です。すでに多くの子どもがAIによるディープフェイクによって被害を受けています。今回の研究で、ガウス・プロービング(Gaussian probing)が非常に有用なツールとなり得ることが示されました。この問題に対して、研究コミュニティが一層注力することを願っています」とウィルソン氏は述べています。
重要なのは、この手法がスケーラブルであり、実装コストも比較的安価である点です。毎月オンライン上で公開されるモデル変種は数千に上るため、有害な改変が広く流通する前に監査担当者が除去できるよう、拡張性が不可欠です。
また、ガウス・プロービングは他の監査手法よりも頑健です。悪意のある行為者が検知を回避しようとしても、ベースモデルの内部動作を慎重に変更する必要があり、容易には隠し通せないからです。
今後は、研究チームがより多くのモデル変種を対象にこの手法を検証するほか、調整が行われる前にベースモデル自体に有害な機能が潜んでいないかをガウス・プロービングで検出できるかどうかも探求していく方針です。
「今、この懸念に部分的に対処するための技術的アプローチが生まれました。多くの子どもたちが国境を越えて被害を受けている深刻な問題に取り組むために、私たちは多大な努力を注ぎました。この分野で変革的な影響を与えられることを願っています」とガセミ氏は語ります。
本研究は、ブリッジウォーター AIA ラボ研究奨学金の一部の支援により実施されました。
AI算出
主要ニュースainew評価高い
AI モデルの安全性と違法コンテンツ防止という核心的なテーマであり、従来のプロンプトベースのテストでは不可能だった「出力生成なしでの検知」という技術的ブレークスルーを報じているため新規性は高い。MIT の研究結果として明確な新事実が含まれるが、特定の商用製品名やバージョン番号ではなく学術的な手法の発表であるため検索機会スコアは中程度となる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 75
- 新規性
- 75
- 調べる価値
- 50
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み