vLLM V0 から V1 へ:RL における修正前の正しさの重要性(8 分読了)
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
vLLM は V1 アップデートにより、ログ確率計算や重み更新の不整合を解消し、V0 と同等の推論精度と RL パフォーマンスを確保した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
vLLM V1 のアップデートは、logprob 計算の不一致、ランタイムデフォルト、実行中の重み更新、最終投影精度の問題に対処することで推論の正しさを改善しました。主な修正には、処理済みの logprobs の調整、プレフィックスキャッシュの無効化、重み更新モデルの整合性確保、vLLM V0 の動作と合わせるための fp32 lm_head 計算の実装が含まれます。これらの変更により初期トレーニングの不整合が解消され、新しいエンジンが不要な目的関数側の修正なしに期待される RL パフォーマンスを維持することが保証されました。
原文を表示
The vLLM V1 update improved inference correctness by addressing discrepancies in logprob computation, runtime defaults, inflight weight updates, and final projection precision. Key fixes included adjusting processed logprobs, disabling prefix caching, matching weight update models, and ensuring fp32 lm_head computation to align with vLLM V0's behavior. These changes resolved initial training mismatches, ensuring the new engine maintains expected RL performance without unnecessary objective-side corrections.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み