火山引擎が多模態 AI 処理を内蔵した「SenseFlow」をオブジェクトストレージに搭載
本文の状態
日本語全文を表示中
詳細モードで約17分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
ByteDance Engineering
ByteDance の火山引擎は、多模态大モデルやベクトル検索機能を内包した「SenseFlow」をオブジェクトストレージ TOS に統合し、データ搬出なしで桶内で理解・加工・検索を可能にする新機能を発表した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月10日 21:15
AI深層分析
キーポイント
コスト氷山の解消
従来の AI 能力実装では必要だったデータ搬送、GPU 調達、モデル選定、インデックス構築などの隠れたコストと複雑さを排除し、単一ルール設定で処理を完結させる。
TOS 内建の多機能統合
SenseFlow は TOS の外部プラグインではなくストレージ層に直接組み込まれており、画像・動画・音声などの非構造化データを桶内で即座に理解し処理できる。
ワンクリック展開機能
データ範囲の指定とテンプレート選択のみで数ステップ以内に処理パイプラインを構築でき、既存のインフラ変更や外部キー管理を不要にする。
存算一体的原地闭环处理
SenseFlow は感知と加工を TOS 内部で完結させ、データ転送による帯域・遅延・コストの増加を防ぐ。これにより AI アプリケーションの導入期間が数週から数日へと短縮される。
多模态 AI を活用した自動インデックス化
VLM による動画理解や画像分析を通じて、ファイルに自然言語での詳細説明と要約を自動付与し、検索可能なメタデータを生成する。
重要な引用
「この発表が重要なのは、従来の AI 能力実装において水面下に隠れていた巨大なコストと複雑さを解消するからだ」
「データ不出桶、配置一条规则,即可就地变得可查、可用」
外部方案的路径是“拉出 → 处理 → 回写”,数据在存储与算力之间往返搬运,带宽、时延与成本随之层层累加。
原本要紧盯屏幕的安防运营,如今只需要用自然语言一句提问即可获得结果。
編集コメントを表示
編集コメント
ストレージと AI 処理の境界を曖昧にするこのアプローチは、データサイエンスチームのワークフローを根本から変える可能性を秘めている。特に大規模な非構造化データを扱う企業にとって、インフラコストの削減と開発効率化の両面で即効性のあるソリューションとなり得る。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
火山引擎存储 2026-08-10 18:30 北京
能力速览:火山引擎对象存储 TOS 推出 SenseFlow(内容感知与处理)
SenseFlow 是内建于 TOS 的多模态智能处理工作台,只需配置一条规则即可启用。过去,多模态大模型、向量检索和媒体处理能力都需要独立搭建;如今这些能力已统一集成至存储侧。桶内的图片、视频、音频无需导出,即可就地完成理解、检索与加工。
对象存储是 AI 时代的数据底座。近年来,Data+AI、多模态 AIGC 以及 Agent 应用集中爆发,客户存入 TOS 的图片、视频和音频数量快速增长,新的业务难题也随之而来:数据虽然已经存下,却看不懂、找不到,更难以直接使用。例如,回溯一段“穿红衣人员闯入”的监控录像,从千万素材中检索“海边日落”的图片,或是批量完成视频字幕擦除、抽帧、转码等任务。面对这些诉求,传统对象存储都解决不了。
一、自建链路,成本像一座冰山:水面上是“接入”,水面下才是大头
梳理上述业务诉求不难发现,无论是安防录像回溯、媒资素材检索,还是批量视频处理,本质上均要求存储系统“看懂”非结构化数据内容,并按语义完成检索与加工。传统对象存储只保障数据的可靠存取,无法理解对象内部信息。因此,客户不得不在存储之外自行搭建一整套数据处理链路,才能支撑此类业务。
客户常说的只是一句“接入一个 AI 能力”,这不过是露出水面的尖角。真正沉在水面之下的,是一条逐环衔接、持续产生隐性投入的自建链路,每一环成本都不小:
- 环节:客户需要自己做的事 / 隐含成本
- 数据搬迁:把桶内的存量与增量对象导出到独立的处理集群 / 带宽、时延,以及数据的二次存储
- 算力与模型:采购、部署 GPU 与多模态模型服务,并持续调优 / 资源常年占用,运维门槛高
- 内容理解:对接 OCR、视频分析、VLM 等模型,从对象中提取语义 / 模型选型复杂,效果难保证
- 检索体系:自建向量库、维护索引,以此支撑语义检索 / 额外系统建设,数据再存一份
- 编排与消费:用消息队列、函数把各环节串起来,并将结果回写存储 / 链路长、易出错、难排查
- 权限与计量:在多套系统之间对齐权限、按用户拆分用量 / 策略难维护,成本算不清
上面六个环节大多沉在水面之下。决策时只看到“接入一个能力”的轻巧,上线后才发现,本应聚焦业务的团队,大量精力被耗在基础设施的拼装和维护上。链路每增加一跳,带宽、时延、成本就随之攀升,权限和计量也常年对不齐。最终,一个 AI 能力的上线动辄耗时数周乃至一两个月——水面下的时间与成本,才是真正拖住业务节奏的隐性负担。
成本冰山 · 水面下的隐性投入
コストの氷山:水面に見えるのは AI 機能の追加だけだが、その下には企業が自ら対応すべき 6 つの隠れたコストが潜んでいる。
SenseFlow の設計思想はここにあります。各顧客がストレージの外で再び車輪を造るのではなく、「理解」「検索」「加工」といった機能を TOS(オブジェクトストレージサービス)に直接内蔵させることで、データがバケットから出ることなく、設定ルールを 1 つ追加するだけで即座に検索・利用可能な状態に変換できます。
まずは製品概要を確認し、その実現を支える「ワンクリック展開」と「ストレージと計算の一体化」の 2 つの仕組みを詳しく解説します。その後、インテリジェントセキュリティ、メディア資産管理、カスタムワークフローという 3 つの実務シナリオを通じて、実際の価値がどう発揮されるかを見ていきましょう。
二、製品ポジション:TOS に内蔵されたマルチモーダル・インテリジェンス処理プラットフォーム
SenseFlow は TOS の外側に設置される AI プラグインではありません。ストレージに内蔵され、バケット(Bucket)と連携して動作するインテリジェント機能のレイヤーです。
製品の核となる抽象化単位は「ルール(Rule)」のみです。これは「データ範囲+テンプレート+ワークフロー」を指します。ユーザーが対象データを指定し、シーンに合わせたテンプレートを選択すれば、既存および新規のオブジェクトが自動的に取り込まれます。データの移転も独自パイプラインの構築も不要で、「理解」「検索」「加工」といった機能がすぐに使えます。
一言でまとめると、TOS を単なる「オブジェクトの保存場所」から「オブジェクトを理解するプラットフォーム」へと進化させ、バケット内でデータと知識を直接結びつけるものです。
三、ストレージネイティブの強み:データ原地でのインテリジェンス化
3.1 ワンクリック展開 —— テンプレート選択で即座に有効化
従来のアプローチでは、「理解」「検索」「加工」の連携を実現するために、ベクトルデータベース、OCR、動画分析、通知サービスなど複数のシステム間を頻繁に接続する必要がありました。利用可能なパイプラインを構築するだけでも数週間かかるのが常でした。
SenseFlow はこれらの機能を 1 つの設定ユニットに集約しました。使い方は TOS のライフサイクルルールと似ています。データ範囲の指定、シーンテンプレートの選択、事前設定されたワークフローの確認、そして「有効化」ボタンを押すだけで、4 ステップでルールが完成します。これにより、既存および新規オブジェクトは自動的に取り込まれ、データの移転や独自パイプラインの構築、外部キーの管理は一切不要になります。
同じバケットに複数のルールを同時にマウントでき、それぞれ異なるデータ範囲とテンプレートに紐付けることができます。例えば、「cameras/*」をインテリジェントセキュリティ向けに、「photos/*」をスマホのアルバム用に割り当てれば、両方のルールは互いに干渉せず、独立して動作します。これにより、同一バケット内の用途別のデータを明確に分けて管理できるようになります。
ルールが有効化されると、それに伴う処理能力も同時に稼働します。これらの能力はバラバラな個別のツールではなく、相互に連携した統合システムです。データがバケットに入れば、自動的に順次フローして処理されます。以下に主要な機能の一覧を示します。
- 機能段階:役割 / 技術概要
- コンテンツ認識:多モーダル AI モデル(VLM など)を呼び出して画像や動画の内容を理解し、画面要素と重要なイベントを抽出 / ビデオのフレーム切り出し + VLM による構造化理解
- ファイル注釈:各ファイルに対して約 100 文字の詳細説明と約 20 文字の簡潔なサマリーを自動生成し、検索可能な標準メタデータとして蓄積 / 構造化フィールドをオブジェクトのカスタムメタデータ(Meta)に書き戻す
- マルチモーダル検索:セマンティック特徴と説明文をベクトル化してインデックスを作成。自然言語による「テキストで画像を検索」「テキストで動画を検索」に対応し、ミリ秒単位で結果を返す / キーワード + 意味 + ハイブリッド検索、および再ランク付け
- コンテンツ生成:トランスコード、字幕除去、フレーム抽出、GIF 生成、音声認識などのオペレーターを編成。ストリングまたは並列で組み合わせ、結果を TOS に書き戻す / プリセットワークフロー + オペレーター編成
- ビジネス消費:処理結果をダウンストリームシステムに連携し、イベント通知によって自動で次のプロセスをトリガー。完全なデータ消費チェーンを形成 / Webhook / イベント購読 / サイト内メッセージ
3.2 存算一体:データをバケットから出さず、その場で処理
これが SenseFlow と「外部 AI プラットフォーム」の決定的な違いです。従来の外部アプローチは「取り出して→処理して→書き戻す」という流れで、データがストレージと計算リソースの間を往復します。これにより帯域幅、レイテンシ、コストが積み重なってしまいます。一方、SenseFlow は認識から加工までをすべて TOS 内部で行うため、処理結果もユーザー自身のバケット内に直接残ります。
従来のアプローチ:取り出し→処理→書き戻し
データは独立した検索システムやナレッジベース、処理システムへ移動させる必要があり、リンクが長く設定も複雑です。帯域幅とレイテンシに負荷がかかり、権限管理が統一されにくく、結果のフィードバックも弱くなります。
SenseFlow:その場でのクローズドループ
データの移動は不要で、自然な形でクローズドシステムを構築し、すぐに利用可能です。帯域幅の使用量とレイテンシが同時に削減され、AI アプリケーションの導入期間も「数週間」から「数日」へと短縮されます。
四、ビジネスシーンでの実践:汎用テンプレートとカスタムワークフロー
#### 4.1 インテリジェントセキュリティ:膨大な録画データから「一言で事件を遡る」
カメラ端末側でビデオストリームを断片化し、TOS に継続的にアップロードします。データ量は膨大で TTL(生存時間)も短く、連続録画とアラート時のスナップショットが混在しています。過去には、膨大な録画の中から特定のイベントを探す際、人手による逐次的な確認しか手段がありませんでした。
SenseFlow のインテリジェントセキュリティテンプレートでは、5 つのワークフローをプリセットしています。「クラウド録画のインテリジェント検索」「インテリジェントアラート巡回」「動画の説明サマリー生成」「毎日の自動要約」「動画へのインテリジェント質問」です。新しいデータがバケットに入ると、「ビデオフレーム切り出し → VLM による動画理解 → ベクトル化 → インデックス書き込み」という処理が自動的に実行されます。また、アラート時のスナップショットはリアルタイムで「不審人物」「火災・煙」などの注目点と比較され、定期的に当日の録画要約も生成されます。以前は画面を注視し続けていたセキュリティ運用担当者は、今では自然言語で一言質問するだけで結果を得ることができます。
実践事例:監視カメラ映像の自動検索サービス構築
あるセキュリティ企業は、多数のカメラによる録画データや警報時のスナップショット画像、そしてデバイスごとのメタデータを保有しています。これらのデータは通常、時間軸で分割されオブジェクトストレージに書き込まれ、7〜30 日という期間でローリング保存されています。
従来の場合、膨大な録画の中から「特定の時間帯に誰かが入室したか」「車両や火災、転倒、ヘルメット未装着などの事象が発生したか」を検索するには、独自に動画のフレーム抽出、モデル呼び出し、タグ付けライブラリ、ベクトルデータベース、検索インターフェース、通知連携などを構築する必要がありました。工程コストは膨大であり、新たな業務ルールが追加されるたびに処理フローを見直す必要がありました。
SenseFlow はこの一連のワークフローを TOS(オブジェクトストレージ)バケット内に統合しました。オブジェクトがバケットに格納されると、自動的に知覚・インデックス化・事象判定・結果の書き込みがトリガーされ、録画データは「時間軸でしか検索できないファイル」から、「意味検索やルール処理の対象となるイベント資産」へと進化します。
ソリューションのフロー:
- エンド側のカメラが連続録画をスライスし、イベント発生時のスナップショット画像を TOS バケットへアップロードします。
- バケットには SenseFlow のインテリジェントセキュリティテンプレートを設定し、プレフィックスやイベントディレクトリなどの条件で処理範囲を限定します。
- SenseFlow は新規オブジェクトに対して自動的に動画のフレーム抽出、画像・動画の理解、テキストのベクトル化、タグ付けインデックス化を実行します。
- クライアントプラットフォームは、既存の録画再生機能を変更することなく、自然言語による検索、イベントフィルタリング、日次サマリー、そしてスマート Q&A の入口を追加できます。
4.2 媒資管理 —— 素材のアップロードと同時にタグ付け、派生処理、検索が可能に
ショートドラマやメディア資産、UGC(ユーザー生成コンテンツ)プラットフォームなどの素材庫は、規模が数百万から数千万件に及ぶことも珍しくありません。字幕の除去、フレーム抽出、トランスコード、テキストによる動画検索などは日常的な必須要件です。
SenseFlow の媒資管理テンプレートにより、素材をアップロードする瞬間に加工処理が完了します:
① コンテンツ知覚
ドキュメント、画像、ビデオは書き込まれると同時に多モーダル理解がトリガーされ、セマンティックインデックスと逆インデックスが構築されます。
② 派生処理
字幕除去、トランスコード、フレーム抽出、音声認識などの演算子が自動的に実行され、生成物は指定されたパスに保存されます。
③ セマンティック検索
一言で動画を検索できるほか、字幕や OCR 結果、タグ、時間軸から素早く利用可能な断片を特定することも可能です。
実践事例:短編漫画ドラマ『Seedance』の動画自動処理
短編漫画ドラマのクライアントは、火山方舟 Seedance を活用して動画を大量生成しています。しかし、生成された素材が増えるにつれ、制作チームは以下の 3 つの高頻度な課題に直面しました。
- 素材生成コストの抑制:一部の素材は低画質で生成されるため、後工程で高画質版が必要になることがあります。
- 字幕付き素材への対応:字幕を消すために再生成すると、追加のコストが発生します。
- 素材の迅速な検索と再利用:ファイル名やディレクトリ構造だけでは、物語・キャラクター・シーン・アクションなどの要件に合致する素材を素早く見つけることが困難です。
SenseFlow は、TOS(オブジェクトストレージ)データフロー上に動画処理能力を配置します。動画素材がユーザーが設定したバケットに格納されると、ワークフローに従って自動的に必要な演算子を呼び出し、処理結果を再度書き込みます。これにより、素材は「生成後に人手で整理する必要があるファイル」から、「制作工程へ直接投入でき、意味検索も可能なコンテンツ資産」へと進化します。
処理フローの概要:
- クライアントの業務システムが火山方舟 Seedance を呼び出して動画を生成し、TOS データ購読機能を通じて、自動的にクライアントの TOS バケットへ配信されます。
- クライアントは、TOS バケット、指定されたプレフィックス、または特定の ObjectSet に基づいて SenseFlow のルールを構成します。これにより、新規オブジェクトが処理対象範囲に自動で含まれます。
- SenseFlow は、クライアントの構成ルールに基づき、動画の超解像(アップスケール)、字幕消去、多モーダル理解、インデックス構築を自動的に実行します。
- 処理後の動画は、ユーザーが設定したパスへ自動的に書き戻され、後工程の制作プラットフォームで選定・検索・編集・素材の再利用が可能になります。
4.3 カスタムワークフロー:演算子をレゴブロックのように自由に組み合わせて処理チェーンを構築
事前定義されたテンプレートでは要件を満たせない場合、SenseFlow はビジュアルなカスタムオーケストレーションを提供します。キャンバス上で演算子ノードを引き出して接続するだけで、「入力ソース → 演算子編成 → 出力」という独自の処理チェーンを構築できます。
演算子ライブラリには、画像処理、動画処理、AI 理解、ドキュメント処理、ベクトル化、生成、通知など多岐にわたるカテゴリの一般的な演算子が蓄積されています。動画のフレーム切り出し、VLM(Vision Language Model)による理解、OCR、字幕消去、アニメーション生成なども含まれています。各演算子は個別に API 仕様を確認したりデバッグしたりでき、保存すればテンプレートで参照可能となり、ルール構築に活用できます。
実践事例:具身知能トレーニングにおける多モーダルデータの処理と管理
ある具身知能(ロボティクス)のクライアントはスタートアップ企業です。同社は、価値の高いモデル訓練やチューニングに多くのリソースを割くべきところ、データ処理や管理に時間を費やしていました。SenseFlow のカスタムワークフローを活用し、火山エンジンが提供する豊富な AI 製品と組み合わせることで、データの自動処理・柔軟な管理・効率的な利用を実現しました。
実装フロー
- 端末側で TOS の SDK を統合し、データを直接パブリックネットワークまたは専用回線経由で Media Bucket にアップロードします。
- 一部の特殊ケースでは、Seedance 2.0 で生成した動画を、設定済みのデータ購読ルールに基づいて自動的に Media Bucket に保存します。
- Media Bucket では SenseFlow のカスタムワークフローを設定し、VLM(Vision Language Model)による自動タグ付けを行います。これにより、学習に活用するフレーム画像が生成され、ベクトル化されたデータのインデックス作成と検索が可能になります。
- 社内の開発者は、火山引擎の ArkClaw を介して TOS の Context Bucket と Vector Bucket に接続し、各業務シーンに応じたデータ検索ニーズを満たします。
- 企業独自のデータセットプラットフォームは、Context Bucket、Vector Bucket、Media / Clip Bucket へ連携することで、学習用データの効率的な管理と活用を実現します。
原文を表示
火山引擎存储 2026-08-10 18:30 北京
image
能力速览:火山引擎对象存储 TOS 推出 SenseFlow(内容感知与处理),作为内建于 TOS 中的多模态智能处理工作台,仅配置一条规则即可启用。以往,多模态大模型、向量检索、媒体处理能力均需独立搭建,如今这些能力统一集成至存储侧。桶内图片、视频、音频无需导出,即可就地完成理解、检索与加工。
对象存储是 AI 时代的数据底座。近年来 Data+AI、多模态 AIGC 与 Agent 应用集中爆发,客户存入 TOS 的图片、视频、音频数量快速增长,新的业务难题也随之而来:数据虽然已经存下,却看不懂、找不到,更难以直接使用。例如,回溯一段“穿红衣人员闯入”的监控录像,从千万素材中检索“海边日落”的图片,或是批量完成视频字幕擦除、抽帧、转码等任务。面对这些诉求,传统对象存储都解决不了。
一、自建链路,成本像一座冰山:水面上是“接入”,水面下才是大头
梳理上述业务诉求不难发现,无论是安防录像回溯、媒资素材检索,还是批量视频处理,本质上均要求存储系统“看懂”非结构化数据内容,并按语义完成检索与加工。传统对象存储只保障数据的可靠存取,无法理解对象内部信息。因此,客户不得不在存储之外自行搭建一整套数据处理链路,才能支撑此类业务。
客户常说的只是一句“接入一个 AI 能力”,这不过是露出水面的尖角。真正沉在水面之下的,是一条逐环衔接、持续产生隐性投入的自建链路,每一环成本都不小:
环节
客户需要自己做的事
隐含成本
数据搬迁
把桶内的存量与增量对象导出到独立的处理集群
带宽、时延,以及数据的二次存储
算力与模型
采购、部署 GPU 与多模态模型服务,并持续调优
资源常年占用,运维门槛高
内容理解
对接 OCR、视频分析、VLM 等模型,从对象中提取语义
模型选型复杂,效果难保证
检索体系
自建向量库、维护索引,以此支撑语义检索
额外系统建设,数据再存一份
编排与消费
用消息队列、函数把各环节串起来,并将结果回写存储
链路长、易出错、难排查
权限与计量
在多套系统之间对齐权限、按用户拆分用量
策略难维护,成本算不清
上面六个环节大多沉在水面之下,决策时只看到“接入一个能力”的轻巧,上线后才发现,本应聚焦业务的团队,大量精力被耗在基础设施的拼装和维护上。链路每增加一跳,带宽、时延、成本就随之攀升,权限和计量也常年对不齐。最终,一个 AI 能力的上线动辄耗时数周乃至一两个月——水面下的时间与成本,才是真正拖住业务节奏的隐性负担。
成本冰山 · 水面下的隐性投入
成本冰山:水面上只看到接个 AI 能力,水面下压着六个要自己扛的隐性成本环节
SenseFlow 的设计出发点正在于此——与其让每位客户在存储之外重复造轮子,不如把“理解、检索、加工”直接内建到 TOS 中:数据不出桶,配置一条规则,即可就地变得可查、可用。
接下来我们先了解产品形态,再逐一拆解支撑这套能力落地的两项机制(一键开箱、存算一体),最后结合智能安防、媒资管理、自定义工作流三个真实业务场景,呈现其实际价值。
二、产品定位:TOS 内建的多模态智能处理工作台
SenseFlow 并非外挂在 TOS 旁的 AI 插件,而是内建于存储、与桶(Bucket)协同工作的一层智能能力。产品核心抽象单元只有规则(Rule),即“数据范围 + 模板 + 工作流”。用户选定一段数据、挑选一套场景模板后,存量与增量对象即可自动接入;无需数据搬迁,也无需自建流水线,理解、检索、加工等能力开箱即用。
一句话概括定位:让 TOS 从“存储对象”升级为“理解对象”,在桶内完成数据与知识的连接。
三、存储原生优势:让“数据原地变智能”
3.1 一键开箱 —— 选定模板,一键启用
传统方案中,要打通“理解 + 检索 + 加工”链路,需在向量库、OCR、视频分析、通知服务之间反复对接,仅搭建一条可用链路的时间就按周计。SenseFlow 将这些能力收敛为一个配置单元,使用方式与 TOS 的生命周期规则类似:选定数据范围、选择场景模板、确认预置工作流、点击启用,四步即可建成一条规则。此后,存量与增量对象自动接入,无需搬迁数据、无需自建流水线,亦无需外部密钥。
同一个桶上可同时挂载多条规则,各自绑定不同的数据范围与模板。例如,将 cameras/* 交给智能安防、photos/* 用于手机相册,两条规则互不干扰、各自运行。至此,同一桶内不同用途的数据得以分开管理。
规则启用后,配套的处理能力同步上线。这些能力并非彼此独立的零散工具,而是相互打通的整体,数据入桶后即可顺序流转。下表为能力概览:
能力环节
做什么
技术概要
内容感知
调用多模态 AI 模型(VLM 等)理解图片、视频内容,提取画面元素与关键事件
视频截帧 + VLM 结构化理解
文件标注
为每个文件自动生成约百字详细描述与约二十字精简摘要,沉淀为可检索的标准元数据
结构化字段回写对象自定义元数据(Meta)
多模态检索
将语义特征和描述向量化建立索引,支持自然语言“以文搜图 / 搜视频”,毫秒级召回
关键词 + 语义 + 混合检索、重排
内容生成
编排转码、字幕擦除、抽帧、动图生成、语音识别等算子,串 / 并行组合,结果回写 TOS
预置工作流 + 算子编排
业务消费
处理结果对接下游系统,通过事件通知自动触发后续流程,形成完整数据消费链路
Webhook / 事件订阅 / 站内消息
3.2 存算一体 —— 数据不出桶,处理在原地完成
这一点正是 SenseFlow 与“外部 AI 平台”的本质区别。外部方案的路径是“拉出 → 处理 → 回写”,数据在存储与算力之间往返搬运,带宽、时延与成本随之层层累加。SenseFlow 则将感知与加工全部置于 TOS 内部就地完成,处理产物也直接留存于用户自己的桶中。
传统方案:拉出—处理—回写
数据需搬迁至独立的检索 / 知识库 / 处理系统,链路长、配置繁琐,带宽与时延均承压,权限难以统一,结果回流也较弱。
SenseFlow:原地闭环
数据无需搬迁,天然形成闭环,开箱即用;带宽开销与时延同步降低,AI 应用的上线周期也从以周计缩短为以天计。
四、业务场景实践:通用模板 + 自定义工作流
4.1 智能安防 —— 从海量录像到“一句话回溯事件”
摄像头在端侧将视频流切分为片段,持续不断地上传至 TOS,数据量大、TTL 短,连续录像与告警抓拍图还混杂在一起。过去想要在海量录像中定位某一事件,基本只能依靠人工逐段排查。
SenseFlow 的智能安防模板预置了五个工作流:云录像智能检索、智能告警巡检、视频描述摘要、每日智能总结、视频智能问答。新片段一入桶,自动执行“视频截帧 → VLM 视频理解 → 向量化 → 写入索引”;告警抓拍图会实时比对“陌生人、火焰烟雾”等关注点,并定时生成当日录像总结。原本要紧盯屏幕的安防运营,如今只需要用自然语言一句提问即可获得结果。
实践案例:视频监控场景自动构建视频搜索服务
某安防客户有大量摄像头录像、告警抓拍图和设备维度元数据,数据通常按时间分片写入对象存储,并按 7-30 天周期滚动保留。在此之前,如果要在海量录像中定位“某个时间段是否有人进入”、“是否出现车辆、烟火、摔倒、未戴安全帽”等事件,必须自建视频抽帧、模型调用、标签库、向量库、检索接口和通知链路,工程投入大,且每新增一项业务规则都要重新调整处理链路。
SenseFlow 把这条链路沉到 TOS 桶内:对象入桶后,自动触发感知、索引、事件判断和结果回写,让录像从“只能按时间查找的文件”转变为“可被语义检索和规则消费的事件资产”。
方案链路:
端侧摄像头将连续录像切片、事件抓拍图上传到 TOS 桶;
桶上配置 SenseFlow 智能安防模板,按前缀或事件目录等条件限定处理范围;
SenseFlow 对新增对象自动执行视频截帧、图片 / 视频理解、文本向量化和标签索引;
客户平台可在不改变原有录像回放能力的前提下,增加自然语言检索、事件筛选、每日摘要和智能问答入口。
4.2 媒资管理 —— 素材入库即完成打标、派生与检索
短剧、媒资、UGC 等平台的素材库规模动辄百万乃至千万级,字幕擦除、抽帧、转码、以文搜视频均是日常刚需。SenseFlow 的媒资管理模板让素材在入库的同时即完成加工:
① 内容感知
文档、图片、视频一经写入即触发多模态理解,沉淀语义与倒排索引。
② 派生加工
字幕擦除、转码、抽帧、语音识别等算子自动执行,产物落至指定路径。
③ 语义检索
一句话即可检索视频,亦可按字幕、OCR、标签、时间快速定位到可用片段。
实践案例:短漫剧 Seedance 生成视频自动处理
短漫剧客户普遍使用火山方舟 Seedance 批量生成视频,随着生成的视频素材增多,制作团队也面临三个高频问题:
控制素材生成成本:部分素材先以低画质产出,后续制作环节需要更高画质版本。
部分素材自带字幕:如果仅为消除字幕而重新生成,会额外增加重新生成素材成本。
素材快速检索复用:仅靠文件名和目录难以快速找到符合剧情、角色、场景或动作要求的素材。
SenseFlow 将视频处理能力部署在 TOS 数据链路上,视频素材进入用户配置的桶后,按工作流自动调用相应算子并将处理结果回写,使素材从“生成后待人工整理的文件”转变为“可直接进入制作、可被语义检索的内容资产”。
方案链路:
客户业务系统调用火山方舟 Seedance 生成视频,通过 TOS 数据订阅将生成视频自动投递到客户 TOS 桶;
客户按 TOS 桶、指定前缀或指定 ObjectSet 配置 SenseFlow 规则,使新增对象进入指定处理范围;
SenseFlow 根据客户配置规则自动执行视频超分、字幕擦除、多模态理解与索引构建;
处理后的视频自动回写至用户配置的路径,供后期制作平台进行选片、检索、剪辑和素材复用。
4.3 自定义工作流 —— 算子像积木自由拼成处理链路
当预置模板无法满足需求时,SenseFlow 还提供可视化的自定义编排:在画布上拖出算子节点并连线,自行搭建一条“输入源 → 算子编排 → 输出”的处理链路。
算子库沉淀了大量常用算子,涵盖图片处理、视频处理、AI 理解、文档处理、向量化、生成、通知等多个类别,视频截帧、VLM 理解、OCR、字幕擦除、动图生成等均在其中。每个算子均可单独查阅 API 说明和调试,保存后即可被模板引用,用于建立规则。
实践案例:具身智能训练的多模态数据处理及管理
某具身智能客户是一家初创公司,大量精力花费在价值更高的模型训练调优中,而非数据处理和管理。通过使用 SenseFlow 自定义工作流,并结合火山引擎丰富的 AI 产品,实现数据的自动处理、灵活管理和使用。
方案链路:
客户在端侧集成 TOS 的 SDK,直接通过公网 / 专线将数据上传到 Media Bucket;
部分 corner case 使用 Seedance 2.0 生成视频后,通过配置的数据订阅规则,将数据自动保存到 Media Bucket;
在 Media Bucket 配置 SenseFlow 自定义工作流,由 VLM 进行打标,生成后续参与训练的截帧图片,并进行向量化数据索引与检索;
员工通过火山引擎的 ArkClaw 对接 TOS 的 ContextBucket 和 VectorBucket,满足各开发者在特定业务场景下的数据检索诉求;
企业自身的数据集平台通过对接 ContextBucket、 VectorBucket 、Media / Clip Bucket,实现训练数据集的高效管理和应用。
阅读原文
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み