- 何が起きた: アリババは次期アーキテクチャのプレビューとしてQwen3.8-Flash-Nextのモデル重みを公開し、NVIDIAはSGLangやvLLMを通じたGB300 NVL72でのアジェンティックコーディング実験をサポートしている。
- なぜ重要: 125BパラメータモデルにN-gram埋め込みを追加し、トークンあたり6Bの活性化で効率化されたMoE構造を採用した。ネイティブ26万トークンのコンテキストをYaRNで100万まで拡張可能とし、KVキャッシュ成長を抑制する新アーキテクチャを実装している。
- 誰に関係するか: NVIDIA GB300 NVL72環境での推論検証やNeMoを用いたポストトレーニングを行う開発者。SGLangやTensorRT LLMによるDay 0サポートを利用できる条件を確認する必要がある。
- 出典: NVIDIA Developer Blog
ページを読み込み中…