ページを読み込み中…
ページを読み込み中…
6件の記事
著者は Kimi K3 のモデル性能をきっかけに、データ品質・構造・規模の寄与と Linear Attention(KDA)や GDN 方案の影響について中立な立場で詳細分析を行った。
中国のAI企業ミニマックスは、長文コンテキストにおける計算コストを削減する新手法「MiniMax Sparse Attention(MSA)」を開発し、109BパラメータのMoEモデルで実証した。同社はさらに推論用カーネルをオープンソース化し、生産環境向けモデル「MiniMax-M3」もリリースした。
MiniMax が開発したスパースアテンションアーキテクチャは、グループ固有の Top-k ブロック選択を用いて、モデル品質を維持しつつ 109B モデルで 1M トークンの推論計算量を約 30 倍削減し、GQA と同等のパフォーマンスを達成しました。
FlashMemory は、DeepSeek-V4 の KV キャッシュのうち将来のトークンが参照する可能性が高い断片を予測し、GPU 上に最も関連性の高い断片のみを保持します。これにより、デバイスのメモリ使用量を約 10〜15% に抑えつつ、下流タスクのパフォーマンスを維持または向上させることが報告されています。
Together AI は、MiniMax-M3 モデルの提供を開始し、100 万トークンのコンテキスト長とマルチモーダル機能を効率的に実現した。
DeepSeekの主力オープンウェイトモデルが、アーキテクチャの改良、スパースアテンションの導入、強化学習による更新を通じて進化した過程を解説。