メインコンテンツへスキップ

ページを読み込み中…

On-policy のはずが Off-policy になる:LLM 強化学習 の rollout mismatchと対策(rollout correction) | AIニュース