字节と南京大学、VLM のプライバシー保護フレームワーク「COVERT」を ECCV 2026 に発表
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
ByteDance Engineering
字节跳动安全研究チームと南京大学は、医療や金融など高敏領域での VLMaaS における多模态プロンプト漏洩対策として、プライバシー保護推論フレームワーク「COVERT」を開発し、ECCV 2026 に採択されたことを発表した。
AI深層分析を開く2026年8月1日 01:25
AI深層分析
キーポイント
VLMaaS 向け初の専用フレームワーク
COVERT は VLM のクラウド推理サービスに特化した最初のプライバシー保護フレームワークであり、視覚入力、テキスト入力、および推論応答のすべてをカバーする。
協変混淆による高精度な暗号化
入力データとモデルパラメータを成対に変換する協変混淆を採用し、サーバー側で暗号化空間内で等価計算を行うことで、機密情報を保護しつつ機能の一貫性を維持する。
反演攻撃への耐性強化
浅層 ViT 注意力における空間可逆リスクを特定し、ユーザーの秘密種子で制御されるノイズ注入と選択的微調整により、高保真な画像再構成を防ぐ。
実用性と効率性の両立
主要な VLM 評価セットにおいて平均精度の低下を 3% 以内に抑え、vLLM 推論エンジン上でのスループットコストも 6% 未満に収めることを達成した。
高い精度維持と強固な防御性能
COVERTはQwen2.5-VLシリーズなどの多様なモデルで平均精度の低下を3%以内に抑えつつ、カスタム調整により隠れ状態からの画像再構成攻撃におけるSSIMを約54%低下させる。
重要な引用
COVERT は VLMaaS のための最初の専用プライバシー保護推論フレームワークである
サーバー側は暗号化空間内で等価計算を完了し、機密情報を保護しながら機能の一貫性を維持する
平均精度の低下は 3% 以内に抑えられ、vLLM 推論エンジン上でのスループットコストも 6% 未満である
COVERT 将多模态隐私保护从高开销的安全计算方案推进到更具实际部署可能性的系统形态
編集コメントを表示
編集コメント
VLM の普及に伴うプライバシーリスクへの対応として、精度と効率を犠牲にしない技術的アプローチが示された点は非常に興味深い。特に、反演攻撃に対する防御策を視覚エンコーダーの特定層に限定して実装した点は、実運用におけるバランス感覚の良さを示している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
タイトル(参考のみ):顶会入选 | COVERT —— 面向视觉语言模型的隐私保护推理框架入选 ECCV 2026
💡 医療、金融、業務自動化など高機密性が求められる分野で、視覚言語モデル(Vision-Language Models, VLMs)の導入が進む中、ユーザーがアップロードする画像やスクリーンショット、領収書、個人情報がクラウド推論サービスにおける重要なプライバシーリスクとなっています。この「VLM as a Service(VLMaaS)」における多モーダルプロンプトの漏洩問題を解決するため、字节跳动安全研究チームと南京大学の研究員らが共同で「COVERT」フレームワークを提案しました。その研究成果『COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning』は、コンピュータビジョン分野のトップカンファレンスである ECCV 2026 に採択されました。
一、研究背景
近年、視覚言語モデル(Vision-Language Models, VLMs)は汎用的な質問応答から、実際のビジネスシーンへと進化を遂げています。VLMaaS モデルでは、リソースが限られるユーザーが画像とテキストプロンプトをクラウドにアップロードし、サーバー側で推論処理を行って結果を返すという仕組みが一般的です。このサービス形態は大モデルの利用ハードルを大幅に下げましたが、新たなプライバシー課題も生みました。ユーザーがアップロードする画像には、顔やナンバープレート、医療画像、財務書類、業務のスクリーンショットなど機密情報が含まれる可能性があり、これらがサーバー側または攻撃者によって復元されれば、深刻なデータ漏洩リスクにつながります。
既存のプライバシー保護手法は、安全性・効果・効率の 3 つの要件を同時に満たすことが困難です。マルチパーティ計算や同種暗号化、信頼実行環境(TEE)に基づく手法は計算と通信のオーバーヘッドが大きく、高次元の視覚入力やリアルタイムなクラウド推論には適していません。一方、差分プライバシーによるノイズ付与手法は、視覚的意味と言語的意味の対応関係を損ないやすく、モデル性能が著しく低下する恐れがあります。
こうした課題に対し、本研究では字节跳动安全研究チームが提案したテキスト大モデル向けの協変混淆(Covariant Obfuscation)手法(関連記事:PrivLLM 協変混淆:プライバシー保護 LLM 推論の効率的実装)を基盤とし、VLMaaS シナリオに特化した COVERT フレームワークを新たに構築しました。COVERT は VLM の多モーダル構造を意識して設計されており、クライアント側で入力データとモデルパラメータを協調的に混淆させ、サーバー側では混淆された状態で VLM 推論サービスを実行します。これにより、実用性を損なうことなくユーザーの画像プライバシーを守ることが可能になります。
本研究の主な技術的貢献は以下の通りです。
- VLMaaS 向けのプライバシー保護フレームワーク:COVERT は、視覚入力・テキスト入力・推論応答をすべてカバーする、VLM クラウド推論サービスに特化した初の実用的なプライバシー保護推論フレームワークです。
- 視覚パイプラインの正確な再パラメータ化:畳み込みパッチ化、ViT 特徴抽出、意味射影などの視覚モジュールに対し、サーバー側で混淆空間内での推論を可能にする、正確に相殺可能なパラメータ変換を設計しました。
- 隠れ状態反転攻撃への対応とカスタムチューニング:COVERT は浅層 ViT のアテンションにおける空間可逆性のリスクを特定し、軽量な効用感知型パラメータ調整によって、高忠実度での視覚再構築能力を抑制します。
- 性能とデプロイ効率の両立:主要な VLM 評価セットにおいて、COVERT は平均精度の低下を 3% 以内に抑え、vLLM 推論エンジン上でもスループットへのオーバーヘッドを 6% 未満に維持しました。
二、COVERT
1、ワークフロー
COVERT は、典型的な VLMaaS(Vision-Language Model as a Service)のシナリオを想定しています。ここではクライアントがプライベートな画像とテキストプロンプトを保持し、サーバー側で VLM をホストして推論能力を提供します。本システムは、一度きりのオフラインでのモデル混淆と軽量なオンライン推論を組み合わせたアプローチを採用しており、複雑な計算処理はクラウド上に残しつつも、サーバー側が平文の入力画像を直接観測することを防ぎます。
具体的な処理フローは以下の 3 つの段階から構成されます。
初期化とモデル混淆: クライアントは秘密鍵を用いて、視覚パイプラインやテキストコンポーネントに関連するパラメータを共変的に混淆させ、その結果をサーバーにデプロイします。
オンライン入力処理: 推論フェーズでは、クライアント側で画像のフラット化、テキストのトークン化、入力の混淆といった軽量な前処理のみを実行し、混淆されたプロンプトをクラウドへ送信します。
クラウドでの混淆推論とローカル復号: サーバーは混淆されたモデル上で推論を行い、結果を返却します。最終的な結果を復号できるのは、秘密鍵を持つクライアントのみです。
2. 共変混淆と視覚エンコーダーへの適応
COVERT は「共変混淆(Covariant Obfuscation)」の考え方を採用し、入力データとモデルパラメータを対になって変換します。単に入力データを撹乱する従来の手法とは異なり、共変混淆ではサーバー側が混淆された空間内で等価な計算を実行できるため、プライバシー保護を実現しつつも、モデルの機能整合性を維持できます。
VLM は通常、視覚エンコーダーと大規模言語モデル(LLM)のデコーダで構成されています。COVERT では、視覚エンコーダー内の主要モジュールに対してそれぞれ適応策を講じています。
- 畳み込みパッチ化モジュール: 畳み込み演算を行列乗算に書き換え、可逆関係を満たすランダム変換行列を構築します。クライアントは混淆された入力にゼロ空間ノイズを注入できますが、サーバー側での計算時にこのノイズは正確に相殺されます。これによりパッチ単位の視覚情報を保護しつつ、推論誤差を導入しません。
- ViT 特徴抽出モジュール: 大規模言語モデルで用いられる共変混淆の原理を継承し、視覚 Transformer に広く見られる加算バイアス、RoPE(Rotary Positional Embedding)の制約、FFN のゲート関数といった構造的課題にも対応します。これにより、混淆後の計算が元のモデルと整合性を持つことを保証します。
- 意味射影モジュール: ブロック対角逆変換、隠れ層の置換、共有アライメントマスクを用いることで、視覚特徴を混淆された LLM の意味空間へシームレスに統合し、その後の多モーダル生成を支えます。
3. 隠れ状態反演攻撃への防御
構造等価なパラメータの混淆だけでは、すべてのリスクをカバーできません。論文では、攻撃者が浅い層の ViT アテンションにおける空間的先行知識を利用し、高忠実度の隠れ状態反演攻撃を行って、ナンバープレートなどの機密視覚情報を復元する可能性が指摘されています。
この課題に対処するため、COVERT は「効用を考慮したパラメータ調整戦略」を導入しました。まず、ユーザーの秘密シードで制御されたガウスノイズを第 1 層の ViT アテンションパラメータに注入します。その後、公開画像データを用いてアテンション行列と正規化層を選択的に微調整し、他のパラメータは凍結します。このプロセスにより、最終的な隠れ状態は元のモデルとできるだけ一致させ、タスク性能を維持しつつも、中間のアテンションパターンを大きく変化させます。その結果、攻撃者が学習軌跡を再現したり空間構造を復元したりすることが困難になります。
3. 実験結果
1. 実験設定
2. 性能とプライバシー保護の両立
COVERT は、広く使われている5つのマルチモーダル評価セットにおいて、モデルの規模やバリエーションに関わらず安定したタスク性能を維持しています。Qwen2.5-VL シリーズでは、平均精度の低下は約1.83%〜2.58%に抑えられ、8-bit 量化バージョンでも約1.68%〜2.81%の範囲内に収まりました。
実験結果から、パラメータの冗長性が大きい大規模モデルほど、COVERT が導入するパラメータ擾乱に対して高い耐性を持つことが示されています。
プライバシー保護の観点では、COVERT は一般的な非適応型逆攻撃に対して空間構造を直接破壊し、攻撃結果をノイズへと退行させます。より強力な適応攻撃に対しても、カスタマイズされていない混濁(カモフラージュ)手法では浅層の視覚情報が漏洩するリスクが残りますが、COVERT のカスタム調整により、ViT の第1層における隠れ状態からの逆攻撃に対する SSIM は 0.3404 から 0.1550 へ低下(54.46% 改善)、MSE は 3275.28 から 4577.28 へと上昇(39.75% 改善)しました。これにより、攻撃者が隠れ状態から識別可能な機密視覚情報を復元することは極めて困難になります。
3. 効率性と実用性
クラウド環境での推論効率については、COVERT を vLLM 上で Qwen2.5-VL-32B にデプロイし、30 の並列リクエスト(各プロンプトに1,064 ビットの視覚トークンを含む)という条件下でテストしました。その結果、平文推論と比較して COVERT は TTFT を 0.86% だけ増加させ、TPOT を 8.65% 増加させるにとどまり、全体のスループットは 5.93% 低下するのみでした。
これは、COVERT が既存の VLM 推論エンジンが持つ KV-cache や並列デコード最適化を継承できていることを示しており、リアルタイムサービスへの展開要件を満たしています。
通信面では、視覚入力の混濁により追加の転送負荷が発生しますが、論文では次元拡張と量化レベルの調整を通じてこのコストを最適化しました。6-bit へ量化することで、転送拡張は約1.30倍に抑えられ、精度への影響も約2.39% に留まります。
複数のサーバー間での多段階通信が必要で、単一リクエストに数分を要する MPC(秘密計算)方式と比較すると、COVERT は標準的なクライアント・サーバーアーキテクチャ下におけるリアルタイム VLMaaS にとってより適したソリューションです。
四、まとめと展望
1. VLMaaS 向けの実用的なプライバシー保護フレームワーク
COVERT は、VLMaaS(Vision-Language Model as a Service)サービスにおける画像のプライバシーリスクに対応するため、安全性・モデル性能・推論効率を両立する「協変混濁(covariant obfuscation)」フレームワークを提案しました。視覚パイプラインの精密な再パラメータ化、隠れ状態反転攻撃に対する専用防御策、そしてテキストコンポーネントとの連携による混濁メカニズムを通じて、COVERT は多モーダルプライバシー保護を、高コストな安全計算から実運用可能なシステムへと進化させました。
実験結果では、Qwen2.5-VL、MiMo-VL、Fara など複数のモデルで安定した性能を発揮し、主要な多モーダルタスクにおける平均精度の低下は 3% 以内に抑えられました。また、高並列推論環境でもスループットへの影響を 6% 以内に抑制することに成功しています。この成果は、医療・金融・オフィス業務や企業向けエージェントなど、プライバシーが敏感な領域での VLMaaS 導入に向けた新たな技術的アプローチを提供するものです。
2. 今後の展望
VLM が複雑なビジネスプロセスにさらに深く組み込まれるにつれ、プライバシー保護は単なるコンプライアンス要件から、多モーダル AI サービスの信頼性を支える基盤能力へと進化します。COVERT は、モデル構造への適応とパラメータ空間での混濁によって実用的なプライバシー保護を実現できる可能性を示しました。今後は、通信コストのさらなる削減、より広範なモデルアーキテクチャへの対応、そして動画や長文脈を扱う多モーダルタスクなどへ研究範囲を広げていく予定です。
(微信アプリで詳細を開く)
原文を表示
原创 字节安全研究团队 2026-07-27 19:00 北京
image
💡随着视觉语言模型(Vision-Language Models, VLMs)在医疗、金融、办公自动化等高敏场景中的落地,用户上传的图片、截图、票据和身份信息正在成为云端推理服务中的关键隐私风险。为解决视觉语言模型即服务(VLMaaS)中的多模态提示词泄露问题,来自字节跳动安全研究团队和南京大学的研究人员共同提出了 COVERT 框架。其研究成果《COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning》已被计算机视觉领域顶级会议 ECCV 2026 收录。
一、研究背景
近年来,视觉语言模型(Vision-Language Models, VLMs)正在从通用问答走向真实业务场景。在视觉语言模型即服务(VLMaaS) 模式下,资源受限的用户通常需要将图像与文本提示词上传到云端,由服务端完成推理并返回结果。这种服务形态显著降低了使用大模型的门槛,但也带来了新的隐私挑战:用户上传的图像可能包含人脸、车牌、医疗影像、财务票据、工作截图等敏感信息,一旦被服务端或攻击者恢复,将造成严重的数据泄露风险。
现有隐私保护方案难以同时满足安全性、效果和效率三方面要求。基于多方安全计算、同态加密或可信执行环境的方案通常计算与通信开销过高,难以适配高维视觉输入和实时云端推理;基于差分隐私的扰动方法则容易破坏视觉语义与语言语义之间的对齐关系,导致模型效果显著下降。
针对上述问题,本文在字节跳动安全研究团队提出的文本大模型协变混淆方法(相关链接:PrivLLM 协变混淆:隐私保护的 LLM 推理高效实现)基础上,进一步面向VLMaaS场景提出 COVERT 框架。COVERT围绕 VLM 的多模态结构进行专门设计,在客户端对输入和模型参数进行协同混淆,在服务端运行混淆后的 VLM 推理服务,从而在不牺牲实用性的前提下保护用户输入图像。
本文的主要技术突破包括:
面向 VLMaaS 的隐私保护框架:COVERT 是第一个专门面向VLM云端推理服务的实用隐私保护推理框架,能够同时覆盖视觉输入、文本输入和推理响应。
视觉管线的精确重参数化:针对卷积 patch 化、ViT 特征提取和语义投影等视觉模块,COVERT 设计了可精确抵消的参数变换,使服务端可在混淆空间内完成推理。
针对隐藏状态反演攻击的定制调优:COVERT 识别出浅层 ViT 注意力中的空间可逆风险,并通过轻量的效用感知调参降低高保真视觉重建能力。
兼顾效果与部署效率:在多个主流 VLM 评测集上,COVERT 将平均精度下降控制在 3% 以内,并在 vLLM 推理引擎上保持低于 6% 的吞吐开销。
二、COVERT
1、工作流程
COVERT 面向一个典型的 VLMaaS 场景:客户端持有私有图像与文本提示词,服务端托管VLM并提供推理能力。系统采用一次性离线混淆与轻量在线推理相结合的方式,将复杂计算保留在云端,同时避免服务端直接观察明文输入图像。
具体流程包含三个阶段:
初始化与模型混淆:客户端基于私有密钥对视觉管线和文本组件的相关参数进行协变混淆,并将混淆后的模型部署到服务端。
在线输入处理:推理阶段,客户端仅执行轻量预处理,例如图像展平、文本分词和输入混淆,再将混淆提示词发送给云端。
云端混淆推理与本地解码:服务端在混淆模型上完成推理并返回混淆响应,只有持有私有密钥的客户端能够解码最终结果。
2、协变混淆与视觉编码器适配
COVERT 采用协变混淆思想,将输入数据与模型参数进行成对变换。与只对输入做扰动的方案不同,协变混淆使服务端在混淆空间中完成等价计算,从而在保护隐私的同时维持模型功能一致性。
VLM通常由视觉编码器和大语言模型解码器组成。COVERT 针对视觉编码器中的关键模块分别设计了适配策略:
卷积 patch 化模块:将卷积操作重写为矩阵乘法,并构造满足可逆关系的随机变换矩阵。客户端可以向混淆输入中注入零空间噪声,服务端计算时噪声被精确抵消,既保护 patch 级视觉信息,又不引入推理误差。
ViT 特征提取模块:继承文本大模型中的协变混淆原语,同时处理视觉 Transformer 中普遍存在的加性 bias、RoPE 约束和 FFN 门控函数等结构问题,保证混淆后的计算仍与原模型对齐。
语义投影模块:通过块对角逆变换、隐藏层置换和共享对齐掩码,使视觉特征能够无缝进入混淆后的 LLM 语义空间,支撑后续多模态生成。
3、隐藏状态反演攻击防御
仅进行结构等价的参数混淆并不足以覆盖所有风险。论文发现,攻击者可能利用浅层 ViT 注意力中的空间先验,对隐藏状态发起高保真反演攻击,恢复车牌等敏感视觉细节。
为解决这一问题,COVERT 引入效用感知的参数调优策略:首先在第一层 ViT 注意力参数中注入由用户私有种子控制的高斯噪声,再使用公开图像数据对注意力矩阵和归一化层进行选择性微调,同时冻结其余参数。该过程让最终隐藏状态尽量保持与原模型一致,以维持任务效果;同时显著改变中间注意力模式,使攻击者难以复现训练轨迹和恢复空间结构。
三、实验结果
1、实验设置
2、效果与隐私性
在广泛使用的五个多模态评测集上,COVERT 在不同模型规模和模型变体中均保持了较好的任务效果。对于 Qwen2.5-VL 系列,COVERT 的平均精度下降控制在约 1.83% 至 2.58% 之间;在 8-bit 量化版本中,平均下降也保持在约 1.68% 至 2.81% 范围内。实验显示,更大规模模型由于参数冗余更强,对 COVERT 引入的参数扰动具备更好的鲁棒性。
在隐私性方面,COVERT 对普通非自适应反演攻击能够直接破坏空间结构,使攻击结果退化为噪声。面对更强的自适应攻击,未经过定制调优的混淆方案仍可能泄露浅层视觉细节;而 COVERT 的定制调优将基于ViT 第一层 隐藏状态反演攻击的 SSIM 从 0.3404 降至 0.1550,下降 54.46%,同时将 反演攻击的MSE 从 3275.28 提升至 4577.28,提升 39.75%。从而使得攻击者难以从隐藏状态中恢复可识别的敏感视觉信息。
3、效率与部署可行性
在云端推理效率上,COVERT 在 vLLM 上部署 Qwen2.5-VL-32B,并在 30 并发请求、每个提示包含 1064 个视觉 token 的设置下进行测试。相比明文推理,COVERT 的 TTFT 仅增加 0.86%,TPOT 增加 8.65%,整体吞吐下降 5.93%。这说明 COVERT 能够继承现有 VLM 推理引擎的 KV-cache 与并行解码优化,满足实时服务的部署要求。
在通信方面,视觉输入混淆会带来额外传输负载。论文进一步通过降低维度扩展和量化等级来优化通信开销,在量化到6bit时可将传输扩展压缩至约1.30 倍,同时仅带来约 2.39% 的精度损失。相较于需要多服务器交互、单次请求耗时数分钟的 MPC 方案,COVERT 更适合标准客户端-服务端架构下的实时 VLMaaS。
四、总结与展望
1、面向VLMaaS服务的实用隐私保护框架
COVERT 针对VLMaaS服务中的图像隐私风险,提出了兼顾安全性、模型效果和推理效率的协变混淆框架。通过视觉管线的精确重参数化、隐藏状态反演攻击的定制防御,以及与文本组件混淆机制的协同,COVERT 将多模态隐私保护从高开销的安全计算方案推进到更具实际部署可能性的系统形态。
实验结果表明,COVERT 能够在 Qwen2.5-VL、MiMo-VL、Fara 等多类模型上保持稳定效果,在多项主流多模态任务中将平均精度下降控制在 3% 以内,同时在高并发推理场景下将吞吐开销控制在 6% 以内。这一结果为医疗、金融、办公和企业智能体等隐私敏感场景中的 VLMaaS 部署提供了新的技术路径。
2、未来展望
随着VLM进一步深入复杂业务流程,隐私保护将不再只是合规要求,而会成为多模态 AI 服务可信落地的基础能力。COVERT 展示了通过模型结构适配与参数空间混淆实现实用隐私保护的可能性,团队后续将围绕更低通信开销、更广模型架构适配、视频与长上下文多模态任务等方向继续拓展。
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み