ページを読み込み中…
ページを読み込み中…
7件の記事
Latent Space のインファレンスエンジニアリングマスタークラスで、起動オーバーヘッド削減のために作成するメガカーネルの有効性や限界について活発な議論が行われた。
Anthropic は Composer のボトルネック解消のため NVL72 向け MoE 訓練メガカーネル Mixture-of-Kittens をオープンソース化し、通信と計算を単一の完全決定性カーネルに融合させた。
LingBot-Map を用いたエンドツーエンドのストリーミング 3D 再構築パイプラインの実装手順を解説し、VRAM に応じて GPU パラメータを自動調整する手法を示した。
メタは過去数年間のモデル能力とデータセットサイズの指数関数的成長に伴い、信頼性が高く高速なストレージアクセスがAI革新の速度と計算コストに不可欠であると指摘し、大規模スケールでのAIストレージ設計指針を明らかにした。
NVIDIAはHugging FaceでNeMo AutoModelを公開し、Qwen3やDeepSeek V3のような大規模Mixture-of-Expertsアーキテクチャの微調整パイプラインを最適化した。同フレームワークはExpert ParallelismとDeepEP融合通信カーネルを導入し、GPUクラスター上で専門的なエキスパート重みを動的に分散させることで、トレーニングスループットを最大3.7倍向上させ、ピークGPUメモリ使用量を32%削減した。