字节跳动、VLDB 2026 に5 篇論文採択、LLM データ準備など発表
本文の状態
日本語全文を表示中
詳細モードで約18分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
ByteDance Engineering
字节跳动データベースチームは VLDB 2026 で 5 篇の論文を発表し、存算分離アーキテクチャにおける性能向上や Agentic LLM を活用したデータ準備システムの革新を明らかにした。
AI深層分析を開く2026年9月2日 08:56
AI深層分析
キーポイント
存算分离架构の性能突破
Terark-DS と WOP の 2 つの技術により、ネットワークボトルネックや Fetch-Before-Write の非効率性を解消し、書き込みスループットを最大 3.33 倍向上させた。
Agentic LLM を活用したデータ準備
DeepPrep は Agentic LLM を用いて自動化されたデータ準備を実現し、GPT-5 の約 1/15 のコストで SOTA な精度を達成した。
大規模グラフ処理の高速化
TDC と gMatch はそれぞれ時系列グラフのコミュニティ検索と GPU 上でのサブグラフマッチングにおいて、既存手法を最大 10 万倍および 36.58 倍加速した。
実環境での大規模展開
Terark-DS はすでに字节跳動の存算分離アーキテクチャ上で大規模にデプロイされ、コスト削減と性能向上が検証済みである。
DeepPrep:LLM による自律型データ準備システム
実行状態ツリーと漸進的学習により、早期の意思決定修正や非局所的な修正を可能にし、データ前処理の自動化を実現する。
重要な引用
写入吞吐提升 20.4%–63.9%,总成本降幅 22.7%–58.6%
生产工作负载吞吐最高提升 3.33 倍,写密集延迟最多降低 85.2%
推理成本约为 GPT-5 的 1/15
相比在线算法最高快 100,000 倍
編集コメントを表示
編集コメント
VLDB 2026 における ByteDance の成果は、理論的な研究が実際のインフラでいかに劇的な効果を生むかを示す好例である。特に Agentic LLM をデータ準備に組み込んだアプローチは、AI とデータベースの融合領域において重要な一歩と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
字节跳动数据库 2026-09-01 17:00 北京
作为数据管理与数据库システム分野で最も影響力のある国際会議の一つ、VLDB 2026 は現地時間 8 月 31 日から 9 月 4 日にかけて米国ボストンで開催されました。今年、字节跳动データベースチームからは 5 篇の論文が採択され、その内容は「キーバリュー分離ストレージエンジン」「書き込みプッシュダウン」「Agentic LLM を用いたデータ準備」「時系列グラフコミュニティ検索」「GPU における部分グラフマッチング」に及びます。
採択された 5 篇の論文概要は以下の通りです。
Terark-DS|存算分離(ストレージと計算の分離)アーキテクチャ向け高性能キーバリュー分離ストレージエンジン。書き込みスループットは 20.4%–63.9% 向上し、総コストは 22.7%–58.6% 削減されました。すでに字节跳動の存算分離基盤で大規模に展開されています。
WOP(Write Operation Pushdown)|書き込み操作をストレージ層まで押し下げ、「Fetch-Before-Write」というデフォルトパスを回避する技術です。生産環境でのワークロードではスループットが最大 3.33 倍向上し、書き込み集中時のレイテンシは最大 85.2% 短縮されました。
DeepPrep|Agentic LLM を活用した自動化データ準備システムです。オープンソースの ADP ベンチマークで SOTA(最良性能)を達成し、Buildings の実世界データセットでは精度 82.85% を記録。推論コストは GPT-5 の約 1/15 です。
TDC(Temporal Durable Community)|大規模時系列グラフにおける永続化コミュニティ検索です。オンラインアルゴリズムと比較して最大 100,000 倍高速で、3314 万本の時系列エッジを持つ Flickr グラフにも拡張可能です。
gMatch|GPU 上での微細粒度部分グラフマッチングです。大規模クエリワークロードでは既存手法に対し最大 36.58 倍の加速を実現し、GPU のアイドルスレッド比率を 5% 未満に抑えました。
また、今回の大会会場では論文発表に加え、以下のセッションも実施されました。
Sponsor Talk:《How AI and Database Work Together in ByteDance Database Products》
Workshop:《Graph Memory for AI Agents — Design and Practice with MemoryBase》
記事の最後には、会場の詳細スケジュールと交流イベントのご案内を掲載しています。ぜひ会場へお越しください。
以下に 5 篇の論文の詳細を紹介します。
Terark-DS:存算分離向け高性能キーバリュー分離ストレージエンジン
論文タイトル:《Terark-DS: A High-Performance and Storage-Efficient Key-Value Separation Storage Engine on Disaggregated Storage》
論文ダウンロード:https://www.vldb.org/pvldb/vol19/p822-zhang.pdf
GitHub リンク:github.com/SZ-NPE/terark-ds
背景と課題
LSM-tree は、高い書き込みスループットを必要とする多くのストレージシステムの基盤となっていますが、「書き込みの増幅(Write Amplification)」という問題は依然として存在します。キーバリュー分離はこの問題を緩和しますが、存算分離アーキテクチャに適用すると新たな問題が発生します。
具体的には、データの複製や頻繁な compaction によりネットワークインターフェースカード(NIC)が飽和し、書き込みスループットが 34.9%–45.5% 低下するケースが見られます。
リモートアクセスでは、ガベージコレクション(GC)の遅延が最大2.03倍に拡大し、必要なストレージ容量も1.96倍に増大します。
中核技術
これらの制約に対処するため、Terark-DS は冗長化戦略、WAL(Write-Ahead Logging)の書き込み手法、そしてGCを統合した一連の技術を採用しています。
差異化された冗長化戦略
各ファイルのアクセスパターンに合わせて最適な冗長化方式を選択します。具体的には、WAL には仲裁機構を、重要な SST には3副本複製を、値データ用の SST には(4:2)の纠删码(EC:エラー訂正符号)を採用し、遅延とストレージコストのバランスを図っています。
適応型 WAL 書き込み
書き込みグループのサイズに応じて、WAL の書き込みモードを「直列」と「並列」の間で動的に切り替えます。これにより、計算とストレージを分離した構成によって生じる追加的なネットワーク往復遅延を相殺します。
ネットワーク効率を重視したガベージコレクション
必要な値データのみを取得する仕組みや、バッチ処理・ローカル化された GC-Lookup、Flat Index Cache(フラットインデックスキャッシュ)、Invalid Tree(無効ツリー)、そして適応型プリフェッチ(先読み)などの機能を組み合わせることで、RPC 呼び出しの削減、冗長なトラフィックの低減、およびストレージ領域の高速な回収を実現しています。
図 1:Terark-DS アーキテクチャ
結果検証
書き込みスループットは 20.4% から 63.9% に向上しました。
総コストは 22.7% から 58.6% まで削減されています。
これらはすでに字节跳动(ByteDance)の分解型ストレージアーキテクチャ上で大規模に展開・検証済みです。
WOP:書き込み操作をストレージ層へ下流化し、無効なリモート読み取りを削減
論文タイトル:『Enhancing Database Write Performance with the Write Operation Pushdown Framework』
論文ダウンロード:https://www.vldb.org/pvldb/vol19/p3847-chen.pdf
背景と課題
B+ ツリーベースのデータベースでは、書き込み処理は通常「フェッチ→修正→書き戻し」のパターンをたどります。つまり、ページ全体を読み込んでからメモリ上で修正し、最後にストレージへ書き戻すという流れです。この方式はローカルストレージ上でもコストがかかるものですが、計算とストレージが分離された環境ではその負担がより顕著になります。16KB のページを一度にリモートで読み込むだけでネットワーク I/O が発生し、さらにセカンダリインデックスによる大量のランダムかつ非連続な I/O が重なれば、書き込みスループットはすぐにボトルネックに陥ります。
中核技術
WOP はこの書き込みパスの前提条件そのものを見直します。判断基準はシンプルです。「すべてのページを計算層へ取り戻す必要はない」という点です。特定の条件下にある書き込み操作については、操作自体をパッケージ化してストレージ層に直接下流化し、非同期で実行することで、「フェッチ・ビフォア・ライト」のステップを回避します。
プッシュログに基づく実行メカニズム
WOP は条件を満たす書き込み操作を「PushLog」と呼ばれる専用ログ形式にパッケージ化し、ストレージ層へ直接書き込んで非同期で実行します。
軽量なメタデータ追跡
各ページごとの最小限のメタデータのみを追跡し、書き込みが下流化条件を満たすかどうかを判断します。これにより計算層のバッファプールへの負荷を抑えつつ、下流化可能な書き込みの数を最大化します。
整合性保証機構
WOP は単一ノード環境でも分散環境でも、トランザクション分離レベルを破綻させることなく動作します。実行中の下流化タスクの可視性を適切に管理し、部分的な障害やノードのクラッシュが発生しても、分散状態の一貫性を維持できます。
「書き込み後読み取り」の最適化
redo ログ付きの旧ページバージョンを仮想ブロック上に保持することで、後の読み取り時に必要に応じてログを再実行し、最新ページを再構築します。これにより、「書き込み直後の読み取り」で発生する読み取り待ちの問題を防ぎます。
図 2:書き込み下推フレームワークのアーキテクチャ図
結果検証
スループット向上:実生産環境での負荷テストでは最大 3.33 倍、合成ベンチマークでは最大 6.7 倍の向上を確認。
レイテンシ削減:合成された書き込み集中型のワークロードにおいて、平均レイテンシを最大 85.2% 短縮。
堅牢性:メモリ容量やインデックス数の異なる環境でも安定して動作。書き込み後の読み込み停止(write-after-read stall)の緩和が可能で、分散デプロイメント環境においても正しさを保証する。
DeepPrep:Agentic LLM によるデータ準備プロセスの再構築
論文タイトル:『DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation』
論文ダウンロード:https://arxiv.org/pdf/2602.07371
背景と課題
データ分析を行う際、モデリングの前段階として必ずデータ準備が必要となる。この工程は、エンドツーエンドの分析フローにおいて 60% から 80% の時間を要する。
具体的には、ソーステーブルの理解、不具合のあるデータのクリーニング、結合処理、フィールドの集計、フォーマットの統一などを行い、分析可能な状態にデータを整える作業だ。
しかし、データ準備の自動化は容易ではない。少なくとも以下の 3 つの課題が存在する。
- 大規模言語モデル(LLM)による一度きりのコード生成では、実行根拠が不足している。
- ReAct スタイルの線形な推論軌道では、初期の意思決定を修正できない。
- 長いパイプラインを処理すると、学習過程で報酬が希薄化する問題が発生する。
中核技術
DeepPrep が解決を目指すのは、このように重く複雑で、完全な自動化が難しいデータ準備の課題だ。
■ 木構造に基づくエージェント推論
パイプライン構築を明示的な実行状態の木として表現する。ノードには物化された中間テーブルを格納し、エッジは実行済みの演算子を意味する。
構造化された「計画→拡張→実行→バックトラック」のインタラクションを通じて、エージェントは複数の候補経路を保持できる。これにより、下流で発生した障害をより初期の意思決定に遡って特定し、局所的な修正ではなく全体を見渡した修正を実行可能にする。再从头開始する必要も、線形軌道に閉じ込められることもない。
■ 段階的なエージェント訓練
問題をいきなり報酬が希薄な強化学習に委ねるのではなく、段階的な訓練パスを採用する。
- 演算子の文法学習
- 木構造推論に基づく教師あり微調整(SFT)
- 多輪組の相対戦略最適化(PPO など)
このプロセスで用いる混合報酬は、最終的な正解性、部分テーブル間の類似度、そして LLM が判定する推論品質を組み合わせる。これにより、実行を意識した計画策定、フィードバックへの対応、解釈可能なバックトラックに対して、より密度の高い監督信号を提供できる。
■ 実行ベースの ADP データ合成
NL2SQL ベンチマークテストを実際の ADP(Autonomous Data Preparation)タスクに近づける。SQL クエリには実用的な分析変換ロジックと目標テーブルを定義し、大規模言語モデルがこれを実行可能な演算子パイプラインに変換する。
その後、一貫性のない日付フォーマットなど、可逆的なデータ品質ノイズを注入。対応するクリーニング演算子がデータを元の状態に復元できるか検証することで、ランダムに連結された演算子の列ではなく、複雑かつ実行可能な訓練用パイプラインを生成する。
図3:DeepPrep システムのアーキテクチャとトレーニングメカニズム
検証結果
オープンソースの ADP ベンチマークにおいて、Synth-Spider、Bird、Parrot の各タスクで SOTA(State-of-the-Art)を達成しました。
推論コストは強固なクローズドモデルである GPT-5 と同程度の精度を維持しつつ、約 1/15 に抑えています。
実世界の Buildings データセットでは、82.85% の精度と 100% の完了率を記録しました。
0.5B から 14B パラメータのモデルに対応しており、オープンソースのコード、合成データ、および重みを提供しています。これにより、計算リソースに応じて柔軟にデプロイすることが可能です。
図4:DeepPrep と ReAct の性能比較
TDC:大規模時系列グラフにおける永続的コミュニティ検索
論文タイトル:『Effective Durable Community Search in Large Temporal Graph』
論文ダウンロード:https://www.vldb.org/pvldb/vol19/p127-zhou.pdf
背景と課題
時系列コミュニティ検索は、「特定の時間窓において、誰が凝集したグループを形成しているか」を答えることはできます。しかし、もう一つの重要な問い、「そのグループはどの程度安定して維持されるのか」という点には答えられません。
大規模な時系列グラフにおいて、候補となる時間窓を列挙して解を探す手法では、計算コストが高すぎます。
中核技術
TDC はこの課題に立ち向かいます。論文で提案された Temporal Durable Community(TDC)モデルは、クエリ頂点を含み、かつ最も長い連続期間においてメンバー構成が変化しない「時間 k-コア」を検出します。
これにより、コミュニティ検索は単に「特定のグループを見つける」だけでなく、「その関係性がどれほど安定して持続するか」という問いにも答えることができるようになります。
時系列永続コミュニティ(TDC)
クエリ頂点、k 値、およびクエリ区間が与えられた場合、コミュニティの継続時間が最も長い連結な時系列 k-コアを検出します。ここで「継続時間」とは、そのコアを構成する頂点集合が形成された後、変化せずに維持される期間を指します。
単調性を利用したオンライン検索(ONCE)
開始時刻が固定されている場合、時間窓を広げていくと時系列 k-コアのサイズは単に増大するか、あるいは現状を維持するだけで、分裂することはありません。ONCE アルゴリズムはこの単調性を活用し、メンバーの変更に二分探索を適用することで高速化を実現しています。
コンパクトな ATG インデックスと増分 AIT
各辺には「アクティブ期間」が割り当てられます。最小生成森林と重要な出辺を用いることで、メンバーの所属関係や次回の更新タイミングを表現できます。ATG インデックスは複数の開始時刻において共有構造を再利用可能であり、AIT は以前に計算されたコミュニティに対して増分的な拡張を行います。
図5:ASF-index 構築の例(k = 2)
検証結果
TDC 関連手法は、オンライン ONCE アルゴリズムよりも最大で 100,000 倍、基礎的なインデックス手法 BIT よりも 1,000 倍高速です。
索引構築速度を最大 100 倍に向上させ、Flickr のような 3,314 万本の時系列エッジを含むグラフへの拡張も可能。必要な ATG-index のサイズはわずか 7.1GB です。
5 つのデータセットにおいて、TDC(Time-Dynamic Community)の平均安定時間は、従来の時系列 k-core コミュニティ検出手法よりも 5.6 倍から 20.2 倍も長いことが確認されています。
gMatch:GPU 上での微細粒度かつハードウェア効率の高い部分グラフマッチング
論文タイトル:《gMatch: Fine-Grained and Hardware-Efficient Subgraph Matching on GPUs》
論文ダウンロード:https://arxiv.org/pdf/2604.10601
Github リポジトリ:https://github.com/SJTU-Liquid/gMatch
背景と課題
部分グラフマッチングは、グラフ計算における基礎的な問題の一つです。不正検出、知識グラフの構築、ネットワークセキュリティなど、幅広い分野で頻繁に利用されています。GPU は並列処理能力に優れていますが、部分グラフマッチングは規則正しく設計されたタスクではなく、ハードウェアのリソースを効率的に埋め尽くすことが難しいケースが多いです。
検索プロセス全体が非常に不規則になる要因として、異なる部分のマッチングに対応する候補頂点の数が大きく偏ることが挙げられます。これにより、GPU の並列能力を十分に活用するのが困難になります。
中核技術
gMatch が解決しようとしているのは、こうしたタスク特性と GPU の実行モデルとの間のミスマッチです。既存の GPU 向け部分グラフマッチングシステムは、通常「粗粒度の実行モデル」を採用しています。これは、1 つの warp(ワープ)が 1 つの部分マッチングを拡張して処理する方式です。
候補セットが縮小したり、その分布が極端に偏ったりすると、warp 内部で多くのレーン(lane)がアイドル状態になり、リソースが無駄になります。評価データによると、この粗粒度実行モデルでは、アイドル化するスレッドの割合が最大 70.74% に達することがあります。
さらに、各 warp はより大きな実行スタックを維持する必要があり、メモリ負荷が高まります。特に大規模グラフや高次数ノードを含むグラフでは、OOM(Out Of Memory)エラーが発生するリスクも高まります。
図 6:gMatch アーキテクチャの全体像
微細粒度並列実行
gMatch では、部分マッチングの拡張処理を独立した「候補チェックタスク」に分解し、それぞれを個別の GPU スレッドに割り当てます。これにより、単一タスクの実行状態管理コストが削減され、実行スタックを共有メモリ上に配置することが可能になります。結果として、より多くの並列リソースを確保できます。
スレッド束(Warp)レベルでのバッチ探索
異なる部分マッチングから生成されたタスクは、まず共有タスクプールに集められ、その後、同じスレッド束(warp)内にまとめて配置されます。1 つのスレッド束で複数の部分マッチングを同時に処理することで、gMatch は本来なら遊んでいたリソースを活用し、不規則な候補セットを GPU 上で効率的に実行できる密集したタスクに変換します。
軽量な負荷分散
微細粒度のタスク生成により、通常の処理プロセス内で十分な並列性が確保されます。スレッド束がアイドル状態になった場合にのみ、「ワーク・スティール(作業盗用)」メカニズムが作動し、動的に負荷を再分配します。これにより、バランスの取れた実行が可能になる一方で、継続的なグローバルスケジューリングによるオーバーヘッドを回避できます。
図 7:複数の部分マッチングにまたがる Warp レベルのバッチ探索
結果検証
gMatch は大規模クエリ負荷において既存手法と比較して最大 36.58 倍の加速を実現し、GPU のアイドルスレッド比率を 5% 以下に抑えました。
大規模グラフ分析においては、本取り組みが示す通り、性能向上は単にタスクを GPU に移行するだけではありません。重要なのは、実行モデルがグラフ検索特有の不規則な負荷に真正面から対応できるかどうかにあります。
附:大会現場交流スケジュール
字节跳动データベースチームは、VLDB 2026 の Research Session、Industry Session、Poster Session、Sponsor Talk、Workshop など複数のセッションで上記研究成果を発表します。参加者は以下の図に記載されたスケジュールを確認し、該当セッションへお越しください。論文著者と直接対話して実装の詳細やデプロイの経験、さらには共同研究の可能性について議論できます。
また、大会期間中には特別交流晚宴も開催されます。海外留学生との間で業務の最新動向について深掘りし、AI の将来展望を共に探求します。人材交流の架け橋となり、就職支援にもつながるよう努めるため、皆様のご参加をお待ちしています。
WeChat で開くにはこちらへ
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み