ページを読み込み中…
ページを読み込み中…
65件の記事
RunPodが、訓練済みのAIモデルを高速で信頼性の高いエンドポイントとしてデプロイする方法を解説する。Dagsterによるオーケストレーションと自動更新を組み合わせたガイドを提供する。
DagsterがRunPod上でLLMトレーニングの各段階を調整し、再現性・拡張性・GPU効率性を確保する方法を示している。
Preferred Networks(PFN)の上田蒼一朗氏が、PFNが開発するKubernetesスケジューラのプラグイン(例:Gangスケジューリング)に対するパフォーマンステストの取り組みを紹介している。
CoeFontがMLOpsを通じて、推論結果の迅速な提供と信頼性向上を実現する技術について紹介。機械学習モデルの開発から運用までの効率化・自動化手法を解説。
HPC環境での機械学習ワークフロー構築において、Prefectを用いてSLURMジョブを管理する方法を紹介。オンプレ環境のML学習部分の効率的な管理を目指す。