ロバストな動画顔偽造検出のためのマルチ周波数融合
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究チームが、単一の軽量な融合手法で2つの手作り特徴量を組み合わせ、より少ないパラメータで高精度な動画顔偽造検出を実現した。Xceptionベースモデルに低周波ウェーブレット特徴と位相特徴を融合するLFWS、およびウェーブレット特徴とLBPを融合するLFWLを構築した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
現在の顔動画偽造検出器は、広域またはデュアルストリームのバックボーンを使用しています。しかし、2 つの手作りキューを単一の軽量な融合で組み合わせることで、はるかに小さなモデルでもより高い精度を達成できることを示します。Xception ベースラインモデル(パラメータ数 2190 万)に基づき、2 つの検出器を構築しました。1 つ目は LFWS で、低周波数のウェーブレット・デノイズ特徴 (Wavelet-Denoised Feature: WDF) と位相のみを用いた空間位相浅層学習 (Spatial-Phase Shallow Learning: SPSL) マップを 1x1 畳み込みで結合するモジュールを追加したものです。2 つ目は LFWL で、WDF をローカルバイナリパターン (Local Binary Patterns: LBP) と同様に融合させたものです。この追加モジュールはパラメータ数をわずか 292 個だけ増やし、総数は 2190 万のままに保ちます—これはより小さい…
原文を表示
Current face video forgery detectors use wide or dual-stream backbones. We show that a single, lightweight fusion of two handcrafted cues can achieve higher accuracy with a much smaller model. Based on the Xception baseline model (21.9 million parameters), we build two detectors: LFWS, which adds a 1x1 convolution to combine a low-frequency Wavelet-Denoised Feature (WDF) with the phase-only Spatial-Phase Shallow Learning (SPSL) map, and LFWL, which merges WDF with Local Binary Patterns (LBP) in the same way. This extra module adds only 292 parameters, keeping the total at 21.9 million—smaller…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み