アリババ、2.4T モデル Qwen3.8-Max を NVIDIA GB300 で提供
本文の状態
日本語全文あり
詳細モードで約6分の本文を読めます。
アリババが公開した2.4兆パラメータの超大規模モデルQwen3.8-2.4T-A95Bを、NVIDIA GB300 NVL72上で1秒あたり4千トークンを超えるスループットで推論可能にする技術的実装とアーキテクチャの詳細が発表された。
記事の3ポイント
超大規模モデルの公開と基本性能
アリババは2.4兆パラメータ(1トークンあたり950億パラメータ活性化)を備えたオープンウェイトモデルQwen3.8-2.4T-A95Bを公開し、複雑な推論やエージェントワークロードに対応する能力を提供している。
ハイブリッドアーキテクチャによる長文脈処理
フルアテンションと線形アテンションを切り替えるハイブリッド構造を採用することで、100万トークンという巨大なコンテキストウィンドウにおいても計算量とメモリ使用量を拘束条件下に保つことに成功している。
NVIDIA GB300 NVL72での実証性能
チューニングなしでFP8精度においてGPUあたり1秒4千トークン超、ユーザーあたり1秒350トークン超のスループットを達成し、NVIDIAとの共設計による最適化が機能していることを示した。
なぜ重要か・誰に関係するか
この発表が重要なのは、2.4兆パラメータという前例のない規模のオープンウェイトモデルが、実用的なスループットで動作する技術的ハードルを克服し、長文脈推論や複雑なエージェントワークロードの実装が可能になったからだ。開発者および企業のAI導入担当者は、このアーキテクチャとインフラ構成を確認することで、自社の大規模タスクに対するコスト効率の高い解決策の検討材料を得ることができる。
同じ出来事を3媒体で確認(3件)同じ出来事を扱う報道を公開時刻順に表示
- vLLM BlogvLLM、Qwen-Maxクラス「Qwen3.8-2.4T-A95B」のDay-0サポートを発表
- Modal BlogModal、Qwen3.8-2.4T-A95B の提供を開始し高速化を強化
- NVIDIA Developer Blog閲覧中
アリババ、2.4T モデル Qwen3.8-Max を NVIDIA GB300 で提供
自動クラスタリングによる表示です。出来事の判断や時刻は各原文でも確認してください。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見る関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み