アリババ、月之暗面「Kimi K3」を霊駿真武M890で最適化し首トークン遅延を35%削減
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Alibaba Engineering
アリババは27日、自社の霊駿真武M890超节点实例が月之暗面の最新大模型「Kimi K3」(2.8兆パラメータ)にDay0適応したと発表し、首トークン遅延を約35%削減して長文処理の効率化を実現した。
AI深層分析を開く2026年8月1日 00:29
AI深層分析
キーポイント
超大規模モデルの国内高算力環境での Day0 適応
阿里云と平頭哥は、月之暗面の最新モデル「Kimi K3」を自社インフラ上で即日(Day0)に稼働可能とし、2.8兆パラメータの MoE モデルを 64 カ以上の真武 M890 チップで構成する超节点で安定実行した。
ICN Switch と高帯域通信によるボトルネック解消
ICN Switch 1.0 を用いた 64 枚の真武 M890 間での 800 GB/s の All-to-All 高速通信を実現し、MoE アーキテクチャにおける専門家並列通信のボトルネックを解消した。
MXFP4 混合精度と KDA 算子最適化による効率向上
真武 M890 がネイティブにサポートする MXFP4 低精度計算と、Kimi K3 の KDA(Kimi Delta Attention)アーキテクチャに対する算子融合・並列計算の深度最適化により、推論効率が大幅に向上した。
実測による性能指標の劇的改善
首トークン時延(TTFT)が約 35% 短縮され、単卡デコードスループットは 1.8 倍に向上し、1M トークンの長文脈処理も安定して可能となった。
重要な引用
首 Token 時延(TTFT)降低約 35%
单卡解码吞吐(Decode Tokens/s)提升约 1.8 倍
稳定支持最长 1M 上下文
Kimi K3 は月之暗面(Moonshot AI)最新の旗艦モデル
編集コメントを表示
編集コメント
アリババグループが自社の AI チップとインフラで、他社製の超大規模モデルを即日適応させた事例は、国内 AI エコシステムの成熟度を示す重要な指標となる。特に KDA アーキテクチャへの深い最適化と MXFP4 の活用は、今後の大規模モデル推論の標準的なアプローチとして注目されるべき技術的知見である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
アリババ技術 2026年7月28日 18:18 浙江
7月27日夜、アリババクラウドの「霊駿真武(リンシュン・シンウ)M890超ノードインスタンス」が、2.8兆パラメータを持つ大規模モデル「Kimi K3」へのDay 0適応に成功しました。チップ、推論プラットフォーム、そしてモデルを統合的に最適化することで、モデルの推論効率が大幅に向上しています。
実測データによると、この超ノードでKimi K3を実行した際の最初のトークン生成までの遅延(TTFT)は約35%短縮され、長いコンテキストを扱う場面でもユーザー体験がよりスムーズになりました。
Kimi K3は月之暗面(Moonshot AI)の最新フラッグシップモデルで、パラメータ規模は2.8兆に達します。混合専門家アーキテクチャ(MoE)を採用しており、その完全なモデル重みは本日ついに公開されました。現在、業界内で最も大規模なモデルの一つであるKimi K3を効率的に運用するには、膨大な計算資源とメモリ容量の確保が不可欠です。さらに、数十枚のGPUを密接に連携させるための高速ネットワークも必要であり、従来のAIクラスターでは高スループット・低遅延・低コストという推論要件を満たすことは困難でした。
月之暗面の公式ブログによると、Kimi K3は「64枚以上のアクセラレーターで構成された超ノード」へのデプロイが推奨されています。
霊駿真武超ノードインスタンスは、平頭哥(Pingtouge)が開発したトレーニングと推論を一体化したAIチップ「真武M890」を基盤としています。ICN Switch 1.0によるチップ間接続技術を活用することで、64枚の真武M890間で800 GB/sという超高速なAll-to-All通信を実現しています。また、メモリ容量は9TBに達し、兆規模のMoEモデルにおけるEP(Expert Parallel)専門家の並列通信トラフィックを、単一の高速通信ドメイン内で完結させることが可能です。これにより、トークン生成の効率性が確実に担保されています。
Kimi K3を真武M890超ノード上でDay 0から効率的に稼働させるため、アリババクラウド、平頭哥、そしてKimiチームは、オペレーター(演算子)やソフトウェアスタックなどの観点から深い連携適応を行いました。真武AIチップのT-Head SAILソフトウェアスタックを基盤とすることで、Kimiが独自開発したMooncake推論フレームワークは迅速なデプロイと「箱を開ければすぐに実行可能」という状態を実現しました。
例えばオペレーターレベルでは、真武M890がTritonに対して優れたサポートを提供しているため、Tritonで記述されたカスタムオペレーターの多くを再実装することなく直接実行できます。これにより、適応にかかる工数が大幅に削減されました。
この基盤の上に、三方はK3の超巨大なMoEアーキテクチャに対し、以下の3つの重点項目で最適化を行いました:
EP専門家の並列通信の最適化
ICN64による高帯域幅通信ドメインを活用し、MoEの中核であるAll-to-All形式の専門家ルーティング通信を深くチューニングしました。2.8兆パラメータに及ぶ専門家の並列トラフィックを単一の超ノード内部で完結させることで、跨ノード通信がボトルネックとなるのを防ぎます。
MXFP4 混合精度推論
真武M890がネイティブでサポートするMXFP4低精度演算能力を活用し、モデルの性能を損なうことなく計算密度とメモリ利用効率を大幅に向上させました。
KDA 混合アーキテクチャオペレーターの深層最適化
Kimi K3は、Kimi Delta Attention(KDA)による線形注意力と完全注意力を組み合わせたハイブリッドアーキテクチャを採用しています。連携チームはこのKDAのコアオペレーターを真武M890上で深くチューニングしました。チップの並列計算アーキテクチャとメモリアクセス特性に完全に適合させ、オペレーターの融合によってカーネル起動や中間メモリアクセスのオーバーヘッドを削減。その結果、注意力計算における計算能力と帯域幅の利用効率が劇的に向上しました。
これらの連携による最適化を経て、Kimi K3は霊駿真武M890超ノードインスタンス上でDay 0から安定して稼働することに成功し、重要な推論指標も大幅に改善されました(以下の数値は段階的な最適化の実測経験値であり、参考用です):
移行初期のベースラインと比較して、最初のトークン生成までの遅延(TTFT)が約35%短縮され、長いコンテキストを扱う場面での体感速度が向上しました。また、1枚あたりのデコードスループット(Decode Tokens/s)は約1.8倍に向上しています。
MXFP4 による混合量化の採用により、推論全体の効率が向上しました。
KDA 線形アテンションの混合アーキテクチャと演算子の最適化のおかげで、長文脈における推論コストは入力長に対してほぼ線形的に増加します。これにより、最大 100 万トークンのコンテキストを安定してサポート可能となり、長文書の理解や複雑な推論処理といったシナリオにも余裕を持って対応できます。
今回の Day0 での適応は、アリババクラウド、平頭哥(Pingtouge)、Kimi チームが、チップから推論フレームワーク、そしてクラウドプラットフォームに至るまで、全スタックで連携した成果です。これにより、Kimi K3 のようなトリリオンパラメータ級の超大規模モデルに対して、オープンソースかつ開放的なソフトウェアスタックと、国内で入手可能な高性能な計算資源の選択肢が提供されました。今後は三社が引き続きモデル適応、性能チューニング、そしてエンジニアリングデプロイメントにおいて協力を深化させ、真武超ノード上での Kimi シリーズモデルの推論性能とコストパフォーマンスをさらに高めていきます。
コメント欄でのご意見をお待ちしています。一緒に議論しましょう。
WeChat で開くにはこちらへ
原文を表示
阿里技术 2026-07-28 18:18 浙江
image
7月27日晚,阿里云灵骏真武M890超节点实例已成功适配2.8万亿参数大模型Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。实测结果显示,该超节点运行Kimi K3的首Token时延降低约35%,长上下文场景下用户体验更流畅。
Kimi K3是月之暗面(Moonshot AI)最新的旗舰模型,参数规模达到2.8万亿,采用混合专家(MoE)架构,其完整模型权重于今日正式开放下载。作为目前业界参数规模最大的模型之一,Kimi K3的高效运行不仅需要大规模算力和显存支撑,还需要高速互联网络让几十张GPU紧密协作,仅靠传统AI集群无法满足高吞吐、低延迟、低成本的推理需求。根据月之暗面官方博客,推荐将Kimi K3部署在“64 卡以上加速器组成的超节点”上。
灵骏真武超节点实例基于平头哥训推一体AI芯片真武M890打造,通过ICN Switch 1.0互联芯片,可让64张真武M890实现800 GB/s的All-to-All高速互联,显存规模也达到9TB,可将万亿级MoE模型的EP专家并行通信流量,跑在一个高带宽通信域内,有效保证Token生成的效率。
为了让Kimi K3在真武M890超节点实例上实现Day0高效运行,阿里云、平头哥与Kimi 团队从算子、软件栈等层面进行了深度联合适配。依托真武AI芯片的T-Head SAIL软件栈,Kimi自研的Mooncake推理框架实现了快速部署及“开箱即跑”。例如在算子层面,真武M890对Triton的良好支持让大量基于Triton编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。
在此基础上,三方还针对K3的超大规模MoE架构做了三方面重点优化:
EP 专家并行通信优化
借助ICN64高带宽通信域对MoE最核心的All-to-All专家路由通信进行深度调优,将2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。
MXFP4 混合精度推理
结合真武M890原生支持的MXFP4低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
KDA 混合架构算子深度优化
Kimi K3采用KDA(Kimi Delta Attention)线性注意力与全注意力相结合的混合架构,联合团队在真武M890上深度调优了KDA核心算子。充分对齐芯片的并行计算架构与访存特性,并通过算子融合减少Kernel启动与中间访存开销,使注意力计算的算力与带宽利用效率大幅提升。
经过联合优化,Kimi K3在灵骏真武M890超节点实例上不仅实现了Day0平稳跑通,关键推理指标也获得可观提升(以下为阶段性优化实测经验值,供参考):
相比迁移初期基线,首Token时延(TTFT)降低约 35%,长上下文场景下体感更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8倍;
借助MXFP4混合量化,提升整体推理效率;
得益于KDA线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M上下文,从容应对长文档理解、复杂推理等场景。
此次Day0适配背后,是阿里云、平头哥、Kimi团队从芯片、推理框架到云平台的全栈协同。这不仅为Kimi K3 这类万亿参数大模型提供了开源开放的软件栈、国内可获取的高算力选择。未来,三方将继续在模型适配、性能调优与工程化部署上深化合作,持续提升Kimi 系列模型在真武超节点上的推理性能与性价比。
欢迎留言一起参与讨论~
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み