ページを読み込み中…
ページを読み込み中…
8件の記事
PyTorch Monarch は、AMD の ROCm プラットフォーム上で数億パラメータを持つ大規模言語モデルの分散トレーニングを可能にする。この技術はハードウェア障害が発生してもジョブ全体を停止せず動的に回復する機能を提供し、安定した大規模 AI インフラ実現への重要な一歩となる。
Google が JAX エコシステムと Pathways を活用し、単一マシンの故障を例外として検知して処理する「弾力性のあるトレーニング」機能を MaxText で実装したことを発表した。これにより、分散 AI 学習時のインフラ再起動が不要となり、効率的な運用が可能になった。
NVIDIA は、分散深層学習の GPU 間通信を最適化する「NCCL Inspector」と「Prometheus」を組み合わせたツールを発表し、トレーニング時の遅延問題を迅速に特定・解決する手法を提供した。
著者らは、tステップ中からkステップをランダムに選択するサンプリング手法のプライバシー増幅特性を検討し、差分学習やプライベート集約において標準手法より有用性が高いことを示した。