ページを読み込み中…
ページを読み込み中…
5件の記事
本書は、TPU や GPU の動作原理や相互通信、実機での LLM 実行方法、および大規模スケールで効率的に動作させるための並列化手法を解説し、トレーニングコストやメモリ要件などの課題への回答を示す。
研究者らは、大規模言語モデル(LLM)の推論において計算ユニットがデータバス速度不足で待機するボトルネックを解消するため、メモリを計算に変換する手法や量子化技術の限界について調査している。
NVIDIA CEOジェンスン・フアンは、AIエージェントがソフトウェアを置き換えるのではなく活用すると説明し、同社はラックアーキテクチャ全体を再設計した。
Appleは、Mシリーズチップの効率コア(「劣った」コア)が単体でも高速であることを強調しており、従来の認識を覆そうとしている。
OpenAIはハードウェア戦略を転換し、従来のNVIDIA GPUではなくCerebrasのウェハースケールチップ上で動作する初の本番AIモデル「GPT-5.3-Codex-Spark」を発表した。同社によると、この新モデルはスループット向上と低遅延を実現し、リアルタイムで対話的なコーディング体験を可能にする。