腾讯混元、投机解码フレームワーク「AngelSpec」を全链路オープンウェイト化
本文の状態
日本語全文を表示中
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tencent Hunyuan
腾讯混元团队正式开源投机解码框架 AngelSpec,同梱 Hy3-A21B の MTP と DFly drafter 重み・コードを公開し、全工程の加速を実現した。
AI深層分析を開く2026年8月1日 00:57
AI深層分析
キーポイント
DFly ドラフターの技術革新
混合ターゲット条件注入と隐状态校正自回归头を採用し、DFlash を上回る平均接受长度(4.79)と構造的タスクでの性能向上を達成した。
高並発環境における D-cut 最適化
検証リソースをバッチレベルで共有し、負荷状況に応じて深層ドラフトの保持または裁断を行うことで、高並発時のスループットを最大 15.7% 向上させた。
MTP と TTT の組み合わせによる汎用性強化
訓練と推論の一貫性を TTT(同策略自回归展开)で修復し、高エントロピーな対話シーンでの平均接受率を 52.8% から 66.4% に引き上げた。
エンドツーエンドの全链路オープンソース化
ドラフターの訓練、アーキテクチャ設計からオンラインデプロイに至るまでのツールと重みコードを包括的に公開し、実利用への移行を容易にした。
長文脈と真の評価機能を備えたフレームワーク設計
TTT と長文脈訓練により逐深度で draft KV cache を成長させ、128k の長文脈に対応する。また vLLM を用いた周期性の実行評価で、代理指標に依存しない平均接受长度と逐位置接受率を直接報告する。
重要な引用
DFly:更强的并行 draft 架构
平均接受长度达 4.79,明显高于 DFlash 的 3.69 和 MTP 的 3.00
并发 48/56/64 相对 DFly 分别提升 +3.0% / +9.2% / +15.7%
TTT 与长上下文训练:逐深度增长的 draft KV cache 免去每步重展开前缀;配合序列并行与序列打包,支持 128k 长上下文训练。
編集コメントを表示
編集コメント
本リリースは、投机解码技術の理論研究から実運用への架け橋となる重要な一歩である。特に高並発環境での最適化手法(D-cut)と対話シーン向けのアプローチ(TTT)は、実際のサービス展開において即座に活用できる価値が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
腾讯混元チームは本日、投機的デコーディング(スペキュレーション・デコーディング)のトレーニングからアーキテクチャ設計、オンライン展開までをカバーするフレームワーク「AngelSpec」を正式にオープンソース化しました。同時に、Hy3-A21B モデルの MTP と DFly ドラフター(drafter)の重みと訓練コードも公開しています。
今回の最大の注目点は、AngelSpec の全工程が完全にオープンソース化されたことです。トレーニングツールに加え、Hy3-A21B の MTP/DFly ドラフターの重みとコードを一式で提供します。
新世代ドラフター「DFly」は新たな SOTA(最良の性能)を達成しました。4 から 64 までの全並列処理レベルにおいて、主要なベンチマーク 6 つすべてで高いスループットを記録し、AR ベースラインと比較して平均 1.98〜2.40 倍の加速を実現(コード・数学分野では最大 2.86 倍)。また、既存の DFlash よりも 10.5〜11.8% 高速化されています。平均受け入れトークン数は DFlash を 30% 上回り、MTP の約 1.6 倍に達しています。
D-cut 技術により高並列処理での性能を最大化し、実際のオンライントラフィックでもスループットがさらに 15.7% 向上しました。また、MTP と TTT(Time-to-Train)の組み合わせによって、会話シーンにおけるトレーニングと推論の不一致という課題を克服。平均受け入れ率は 52.8% から 66.4% に、平均受け入れトークン数は 2.58 から 2.99 に改善されました。
トレーニングからオンライン展開まで、投機的デコーディングによる加速が実際にエンドツーエンドで活用できることを実証しました。
DFly:並列ドラフトアーキテクチャの強化
DFlash は拡散方式を用いてブロック内のすべてのトークンを並列生成しますが、そのドラフティング遅延はブロック長にほぼ依存しません。一方で課題もありました。すべてのドラフト層が同じターゲットコンテキストを共有しているため、ブロック内でのトークン間の相互参照ができず、後段になるほど受け入れ率が急激に低下する問題がありました。
DFly はこれらの課題に対し、以下の 3 つの改良を加えています。
●混合ターゲット条件注入:DFlash の全結合型共有投影(層間相互作用)と DFlare の逐層的加权融合(層ごとの特性を反映)を組み合わせました。これにより、各ドラフト層はグローバルな意味情報と、自身の深さに合わせたターゲット特徴の両方を同時に取得できます。
●隠状態校正用自己回帰ヘッド:並列処理のメイン構造の上に軽量な校正ヘッドを追加し、直前の位置で選択されたトークンを用いて現在の位置の分布を補正します。メイン部分は完全に並列処理を維持しつつ、この校正ヘッドのみが左から右へ順次実行されます。
●受け入れ率最適化のための訓練目標:まず D-PACE で重み付けられた LK 損失を用いて冷間開始(コールドスタート)を行い、その後、エンドツーエンドの TV 損失に切り替えて期待される受け入れ長さを直接最適化します。
三项指标叠加后,DFly 的平均接受长度达到 4.79,显著高于 DFlash 的 3.69 和 MTP 的 3.00;在结构性强的场景中优势更为明显,Math500 测试中达 5.23,HumanEval 测试中更是高达 5.52。
D-cut:将验证过程作为批处理级别的共享资源
长块(long block)在部署时存在代价:在高并发环境下,目标验证会成为计算瓶颈,导致被拒绝的草稿后缀白白占用批次容量。实测数据显示,DFly 在并发数达到 48 后吞吐量即趋于饱和,继续增加并发只会拖慢每个用户的处理速度。
D-cut 在每个解码步骤执行两项关键操作:
首先,利用草稿模型(drafter)对每个 token 的置信度进行估计,推算各请求在不同验证深度下的期望推进量,并跨所有请求进行全局排序,最终保留收益最高的前缀;
其次,结合启动时预先测得的延迟表,选择“期望收益与实际成本之比”最大的验证比例。
突破高并发吞吐天花板
在效果上,该机制实现了负载低时自动保留深层草稿、负载高时主动裁剪的自适应策略。在 Hy3 线上流量回放测试中,当并发数分别为 48/56/64 时,相对 DFly 分别提升了 +3.0% / +9.2% / +15.7%;在保持同等单用户延迟的前提下,聚合吞吐量提高了 14%。
MTP + TTT:解决难以预测的通用对话场景
没有一种草稿模型能通吃所有场景:对话场景熵值较高,长块的后半段大概率会被拒绝;而代码和数学场景的可预测跨度较长,若采用短视界(short horizon)策略又会浪费加速空间。因此,AngelSpec 采用了双草稿模型路线——由 DFly 负责代码与数学任务,MTP 则专注于高熵值的对话场景。
従来の MTP(Multi-Token Prediction)ブロックは、トレーニング時に単一のステップで教師強制学習を行う一方、推論時には自身の予測を再帰的に消費するため、深い位置での受け入れ率が大幅に低下する課題がありました。この「トレーニングと推論の不一致」を解消するために、私たちは TTT(Training-Time Targeted Training:トレーニング時に共有 MTP ブロックに対して同戦略で自己回帰展開を行う手法)を導入しました。さらに、ターゲットモデルのロールアウトによって生成されたデータを活用することで、平均受け入れ率は 52.8% から 66.4% に向上し、平均受け入れ長さは 2.58 から 2.99 へと改善されました。
AngelSpec フレームワーク
前述のドラフター(drafter)はすべて AngelSpec で訓練されています。このツールは TorchSpec をベースに構築されており、その分離型設計を採用しています。具体的には、推論エンジンでターゲットモデルを実行し、隠状態を Mooncake RDMA 経由でトレーニングプロセスへストリーミング転送することで、両側を独立してスケーリング可能にしています。さらに、本報告で提案した手法に対応するため、全工程の拡張を行いました。
● TTT と長文脈トレーニング:ドラフト KV キャッシュを深さごとに逐次成長させることで、各ステップでの前缀再展開が不要となりました。これにより、シーケンス並列処理とシーケンスパッキングを組み合わせ、128k の長文脈トレーニングをサポートしています。
● 実測による受け入れ率評価:組み込みの评估サーバーが定期的に vLLM を用いて最新チェックポイントに対して実際の投機的デコーディング(speculative decoding)を実行します。これにより、損失などの代理指標に依存せず、サービス側での平均受け入れ長さと位置ごとの受け入れ率を直接報告できます。
● プラグイン化:ターゲットモデルや最適化器などを設定ファイルで自由に組み合わせ可能です。新しいアーキテクチャやトレーニング目標も統一されたインターフェースを通じて接続できるため、トレーニングのメインループを変更する必要はありません。
実測結果:DFly の安定したパフォーマンス
Hy3-A21B モデルおよび主要なオープンソースモデルにおいて、DFly は受け入れ長さと実際のスループットで優れた成果を示しました。平均受け入れ長さはさらに向上し、オンラインのリアルトラフィックにおける各種並行処理レベルでも、より高いスループットを達成しています。
実験設定:DFly、DFlash、DSpark の 3 つのブロック拡散ドラフターはいずれも block8 を採用し、MTP は 3 トークンの投機トークンを想定しています。
① 受け入れ長さ:より高品質なドラフトにより、DFly の平均受け入れ長さは Hy3-A21B で 4.79、主要なオープンソースモデルで 5.41 を記録。これは DFlash より約 30% 高く、MTP と比較すると約 1.6 倍の性能です。構造的に複雑なタスクほどその差は顕著となり、HumanEval ではそれぞれ 5.60 および 5.52 に達しました。
② エンドツーエンドのスループット:すべての並行処理レベルで高い値を記録(Hy3-A21B、TP=8、temperature=1。AR ベースラインに対する平均加速比)
DFly-8 は 4 から 64 の全並行処理レベルにおいて、平均して 1.98〜2.40 倍の加速を達成しました。特にコード生成や数学的推論などの単一タスクではピークで 2.86 倍に達しています。さらに D-cut を組み合わせることで、高並行処理下でも追加で 15.7% の向上が見込まれます。
Hy3 やその他のオープンソースモデルに対して、MTP や DFly などの手法で訓練した drafter の重みと、AngelSpec フレームワークをすべて公開しました。ぜひご活用いただき、共に発展させてください。
■技術レポート
https://arxiv.org/abs/2607.25852
■GitHub リポジトリ
https://github.com/Tencent/AngelSpec
■ドキュメント
https://angelspec.readthedocs.io
■Hugging Face コレクション
https://huggingface.co/collections/AngelSlim/angelspec
■ModelScope コレクション
https://modelscope.cn/collections/AngelSlim/AngelSpec
WeChat で開く
原文を表示
原创 腾讯混元 2026-07-29 19:52 广东
image
今天,腾讯混元团队正式开源 AngelSpec。
今天,腾讯混元团队正式开源 AngelSpec。
一个覆盖 drafter 训练、架构设计到线上部署的投机解码框架,并同步开源Hy3-A21B的MTP与DFly drafter 权重及训练代码。
本次开源最大的亮点在于AngelSpec 全链路开源,我们将训练工具 + Hy3-A21B的 MTP / DFly drafter 权重与训练代码一次性放出。
新一代 drafter DFly 取得新SOTA,4–64 全并发档位、六大 benchmark 均取得更高吞吐,较 AR 基线平均加速 1.98–2.40×(代码/数学峰值 2.86×),比 DFlash 再快 10.5–11.8%;平均接受长度较 DFlash +30%、约为 MTP 的 1.6 倍。
D-cut 榨干高并发,线上真实流量额外提升 +15.7% 吞吐;MTP + TTT 攻克对话场景训练-推理不一致,平均接受率 52.8%→66.4%、接受长度 2.58→2.99。从训练到线上,把投机解码的加速真正做到端到端可用。
DFly:更强的并行draft架构
DFlash 以扩散方式并行生成 block 内所有 token,draft 延迟几乎与 block 长度无关,但它有个短板:所有 draft 层共享同一份 target 上下文,且 block 内 token 互相不可见、后段接受率快速衰减。
DFly 针对性地做了三项改进:
●混合 target 条件注入:结合 DFlash 的全连接共享投影(跨层交互)与 DFlare 的逐层加权融合(层特异性视角),每个 draft 层同时获得全局语义和匹配自身深度的 target 特征。
●隐状态校正自回归头:并行主干之上加一个轻量校正头,用前一位置已选 token 修正当前位置的分布。主干保持全并行,只有这个小头从左到右执行。
●面向接受率的训练目标:先用 D-PACE 加权的 LK 损失冷启动,再切换到端到端 TV 损失,直接优化期望接受长度。
三项叠加后,DFly 平均接受长度达 4.79,明显高于 DFlash 的 3.69 和 MTP 的 3.00;在结构性强的场景优势更大,Math500 达 5.23,HumanEval 达 5.52。
D-cut:把验证当作 batch 级共享资源
长 block 有一个部署侧代价:高并发下 target 验证成为计算瓶颈,被拒绝的 draft 后缀白白占用 batch 容量。实测 DFly 在并发 48 之后吞吐饱和,继续加并发只会拖慢每用户速度。
D-cut 在每个解码步做两件事:
用 drafter 的逐 token 置信度估计各请求在不同验证深度下的期望推进量,跨请求全局排序,保留收益最高的前缀;
结合启动时预先测好的延迟表,选择「期望收益 / 实际成本」最大的验证比例。
突破高并发吞吐天花板
效果上,负载低时自动保留深 draft,负载高时主动裁剪。在 Hy3线上流量回放中,并发 48/56/64 相对 DFly 分别提升 +3.0% / +9.2% / +15.7%;同等每用户延迟下聚合吞吐高 14%。
MTP + TTT:搞定不好预测的通用对话场景
没有一种 drafter 通吃所有场景:对话熵高,长 block 后段大概率被拒;代码数学可预测跨度长,短 horizon 又浪费加速空间。所以 AngelSpec 采用双 drafter 路线——DFly 负责代码/数学,MTP 负责高熵对话。
原始 MTP 块按单步 teacher forcing 训练,推理时却要递归消费自己的预测,深层位置接受率大幅下降。我们用 TTT(训练时对共享 MTP 块做同策略自回归展开)修复这一训练-推理不一致,配合 target 模型 rollout 生成的训练数据:平均接受率从 52.8% 提升至 66.4%,平均接受长度从 2.58 提升至 2.99。
AngelSpec 框架
前述 drafter 均由 AngelSpec 训出。工具基于 TorchSpec 构建——采用其分离式设计,推理引擎运行 target 模型、隐状态经 Mooncake RDMA 流式传输至训练进程,两侧独立扩缩——并针对本报告的方法做了全链路扩展:
●TTT 与长上下文训练:逐深度增长的 draft KV cache 免去每步重展开前缀;配合序列并行与序列打包,支持 128k 长上下文训练。
●真实接受率评估:内置评估服务器周期性用 vLLM 对最新 checkpoint 执行真实投机解码,直接报告 serving 侧的平均接受长度与逐位置接受率,不依赖损失等代理指标。
●插件化:target、优化器等通过配置组合;新架构与训练目标通过统一接口接入,无需改动训练主循环。
实测:DFly 表现稳健
在 Hy3-A21B 上和主流开源模上,DFly 在接受长度与真实吞吐上更优:平均接受长度进一步提升,并在线上真实流量的各并发档位上取得更好吞吐。
实验配置:DFly, DFlash, DSpark 三种块扩散 drafter 均采用 block8,MTP 使用 3 个投机 token。
① 接受长度:更好的draft质量,DFly 平均接受长度 Hy3-A21B 达 4.79、主流开源模 达 5.41,较 DFlash 约 +30%、较 MTP 约 1.6×;结构性越强、优势越大,HumanEval 上分别高达 5.60 / 5.52。
② 端到端吞吐:全并发档位更高(Hy3 295B-A21B,TP=8,temperature 1;相对 AR 基线的平均加速比)
DFly-8 在 4–64 全部并发档位均取得平均加速 1.98–2.40×,代码 / 数学单项峰值 2.86×;再叠加 D-cut,高并发下还能额外提升 +15.7%。
我们在 Hy3 及其他开源模型上用 MTP、DFly 等方法训练的 drafter 权重,以及 AngelSpec框架,现已全部开源,欢迎使用与共建。
●技术报告:
https://arxiv.org/abs/2607.25852
●GitHub:
https://github.com/Tencent/AngelSpec
●文档:
https://angelspec.readthedocs.io
●Huggingface:
https://huggingface.co/collections/AngelSlim/angelspec
●modelscope:
https://modelscope.cn/collections/AngelSlim/AngelSpec
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み