ページを読み込み中…
1件の記事
研究者らは、大規模言語モデル(LLM)の推論において計算ユニットがデータバス速度不足で待機するボトルネックを解消するため、メモリを計算に変換する手法や量子化技術の限界について調査している。