ページを読み込み中…
ページを読み込み中…
2件の記事
NVIDIAは、GB300 NVL72システム上でMixture of Experts(MoE)モデルの事前学習において世界最高性能を記録したと発表した。これにより大規模AIトレーニングの限界が根本的に変化する可能性がある。
DeepSeekチームは、CEO梁文鋒共著の新論文で、大規模言語モデルの学習におけるハードウェア課題とアーキテクチャ設計の関係を明らかにした。この研究は、低コストで大規模モデルを訓練するためのハードウェア aware な協調設計の手法を示している。