Hugging Face、リアルタイム対話型オープンウェイトビジョン言語モデル「MOSS-VL」の技術報告を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
OpenMOSS はリアルタイム対話機能を中核に据えたオープンビジョン言語モデル「MOSS-VL」を公開し、視覚入力を生成シーケンス外で処理することで遅延を大幅に削減し、能動的行動テストで既存モデルを凌駕する性能を示した。
AI深層分析を開く2026年8月18日 19:26
AI深層分析
キーポイント
リアルタイム対話アーキテクチャの革新
言語デコーダーがゲート付きクロスアテンションを通じて視覚情報のみにアクセスし、生成中にリアルタイムで映像を認識する「見ながら話す」能力を実現した。
能動的行動における性能の突破
ストリーミングベンチマークにおいて、能動的行動を厳密にテストする3つのサブセットで最上位を記録し、オムニMMIプロアクティブアラートでは66.0というスコアを達成した。
推論遅延の劇的な短縮
視覚トークンをデコードシーケンス外に配置することで、同バックボーンのQwen3-VL-8Bと比較して初トークンまでの時間を最大5.1倍まで短縮した。
段階的カリキュラムによる訓練
強固なオフライン基盤モデルに対し、リアルタイム特有の訓練を軽量な最終ステージに集中させる段階的カリキュラムを採用して最適化を行った。
重要な引用
We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability.
MOSS-VL widens its time-to-first-token advantage over same-backbone Qwen3-VL-8B from 2.8x to 5.1x as visual context grows.
sweeping the three subsets that squarely test proactive behavior -- 66.0 vs. 37.5 for the best baseline on OmniMMI Proactive Alerting.
編集コメントを表示
編集コメント
リアルタイム性を「第一級の機能」として位置づけ、アーキテクチャレベルで遅延を解決した点は技術的に極めて興味深い。特に能動的行動テストでのスコア差は、単なる認識精度ではなく、システムとしての応答性における明確な優位性を示していると言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、リアルタイムでの相互作用——話しつつ感知する能力——を中核機能として扱うオープンなビジョン・ランゲージモデル「MOSS-VL」を発表します。このモデルはスタック全体で協調設計されており、言語デコーダーはゲート付きクロスアテンションを通じて視覚情報にのみアクセスするため、生成中に自然に入力されるフレームを見ることができます。また、合成された相互作用データセットが「いつ話すか」「いつ沈黙するか」「いつ修正するか」を指導し、段階的なカリキュラムによってリアルタイム特有の訓練を、強力なオフライン基盤モデルに対する最後の軽量ステージに集約しています。
オフライン環境では、MOSS-VL-Instruct は同等規模のモデルと競合し、時系列推論を要する動画データセットで首位を維持しています。4 つのストリーミングベンチマークにおいて、MOSS-VL-Realtime はオープンソースのストリーミングモデルの中で 3 つで最高スコア(残る 1 つでは 2 位)を記録しました。特に、能動的な行動を厳密にテストする 3 つのサブセットでは他を圧倒し、OmniMMI Proactive Alerting ではベストベースラインの 37.5 を大きく上回る 66.0 を達成しています。
視覚トークンをデコード済みシーケンス外に配置したまま 11.3B パラメータで動作する MOSS-VL は、視覚コンテキストが増大するにつれて、同じバックボーンを持つ Qwen3-VL-8B と比較して初回トークンまでの時間を 2.8 倍から 5.1 倍に短縮する優位性を広げています。すべての 5 つのチェックポイント、トレーニングカリキュラム、リアルタイム推論コードは https://github.com/OpenMOSS/MOSS-VL で公開しています。
原文を表示
We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability. It is co-designed across the stack: the language decoder attends to vision only through gated cross-attention, so the model can naturally see incoming frames while generating; a synthesized interaction corpus supervises when to speak, when to stay silent, and when to revise; and a staged curriculum concentrates all real-time-specific training in one light final stage over a strong offline foundation. Offline, MOSS-VL-Instruct is competitive at comparable scale and leads temporal-reasoning video sets. Across four streaming benchmarks, MOSS-VL-Realtime posts the best average on three (second on the fourth) among open-source streaming models, sweeping the three subsets that squarely test proactive behavior -- 66.0 vs. 37.5 for the best baseline on OmniMMI Proactive Alerting. With 11.3B parameters but visual tokens outside the decoded sequence, MOSS-VL widens its time-to-first-token advantage over same-backbone Qwen3-VL-8B from 2.8x to 5.1x as visual context grows. We release all five checkpoints, the training curriculum, and the real-time inference code at https://github.com/OpenMOSS/MOSS-VL.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み