ページを読み込み中…
ページを読み込み中…
8件の記事
Netflix は推薦システムの核心として、手作業で作成した数千もの特徴量に依存する既存スタックから脱却し、LLM ネイティブなアプローチである「GenRec」への移行を目指す方針を明らかにした。
NVIDIA は、自律型コーディング AI エージェントのスキルを活用することで、視覚推論モデルの精度をほぼ手作業なしで90%以上に引き上げる手法を発表した。
著者が RLHF やポストトレーニングの基礎をまとめるため、Finbarr Timbers をポッドキャストに招き、Olmo 型レシピを最先端レベルへ引き上げるための現状と必要な手順について議論した。
TLDR AI は、汎用 Frontier モデルが初期プロトタイプには適している一方、企業のミッションや収益に直結する特殊なユースケースでは、コスト・遅延・信頼性の制約に対応するため独自モデルのポストトレーニングが推奨されると述べている。
研究チームは、SFT(教師あり微調整)、RL(強化学習)、オンポリシー蒸留という異なる事後学習手法がモデルの確率分布に与える影響を分析しました。その結果、RL は既存能力の忘却リスクを抑えつつタスク性能を向上させる一方、SFT は外部データへの引き寄せにより既存能力を損なう恐れがあることが示されました。また、オンポリシー蒸留は教師モデルを上回る可能性があり、サンプリングデータの重要性が確認されました。