ページを読み込み中…
1件の記事
vLLM は、オンポリシー強化学習におけるロールアウトとトレーニングでモデル定義や計算順序の違いが生じる不整合を解消し、トークン確率のズレを防ぐ実行手法「IsoExec」を SkyRL で実証した。